人声分离与伴奏提取

使用 AI(demucs htdemucs_ft 模型)从任意歌曲中分离人声与伴奏,一键下载包含人声和伴奏音轨的 ZIP 压缩包。

免费 AI 人声分离与卡拉OK伴奏制作工具。 在浏览器中把任意歌曲一键拆分为干净的人声音轨与伴奏(卡拉OK)音轨。基于 Meta 开源的 demucs 模型(htdemucs_ft)——这是音频工程师在音乐制作中实际依赖的同一套 AI。无需注册、无水印,音频在我们服务器上处理后,两个音轨会打包到同一个 ZIP 中返回。

选择音频文件或将文件拖到此处
将 MP3/WAV/FLAC/M4A 文件拖入此处即可开始
已选择文件: -
注意:本工具会将音频上传到服务器进行 AI 处理,请勿上传敏感文件。
处理较长歌曲时可能需要一些时间(CPU 运行 AI 模型)。

关于人声分离

什么是人声分离?

人声分离(也叫去人声音轨分离)是把一首完整的歌曲拆成两个部分:人声(演唱、说唱或讲话)和伴奏(其余所有乐器:鼓、贝斯、吉他、键盘、合成器等)。这是卡拉OK 不需要现场乐乐队的技术基础,也让音乐制作人可以采样、重混或翻唱从未单独发行的歌曲。

在 2010 年代后期之前,这要么需要拿到原始录音棚的分轨文件(极其罕见),要么只能靠反相技巧——而且只在单声道录音上有效。现代 AI 模型(例如 demucs)能直接把一首完整混音的歌曲作为输入,输出两条干净的音轨,哪怕作品有大量混响、侧链压缩或多层伴唱也照样能分离。

如何使用本工具

  1. 准备音频。 任何常见格式都可以——MP3、WAV、FLAC、OGG、M4A、AAC、OPUS、WMA、AIFF 或 M4B。采样率会自动归一化,位深保持不变。
  2. 把文件拖进 上方上传框,或点击浏览。文件名会显示在上传框下方。
  3. 选择输出格式。MP3 得到体积小、所有设备都能播放的文件;选 WAV 得到适合在 DAW 中继续编辑的无压缩母带。
  4. 点击「开始分离」。 浏览器把文件上传到我们的服务器,由 AI 模型(htdemucs_ft)处理。进度条会先显示「正在加载 AI 模型」(首次使用才会出现),随后转为「正在分离人声与伴奏」。一首 3 分钟的歌曲通常需要 60–180 秒。
  5. 下载 ZIP。 处理完成后,点击「下载 ZIP(人声 + 伴奏)」即可获得一个压缩包,里面是两条音轨。两条音轨的节奏和音高与原文件完全一致,可以直接拖进项目里用。

提高分离效果的几个要点

  • 尽量用最高质量的源文件。 128 kbps MP3 这类有损格式会引入 AI 无法还原的伪影。320 kbps MP3、AAC、FLAC 或 WAV 源文件的清晰度会明显更好。
  • 片段越短,效果越好、越快。 只需要副歌或主歌的话,先在 DAW 里切出来;模型会对整段音频做分析。
  • 单声道也能用。 大多数流行、摇滚、嘻哈作品都是立体声混音,但 AI 处理单声道源同样出色。
  • 过度母带是分离的大敌。 响度战争中被砖墙限制限幅过的曲目会丢失模型所依赖的空间信息。专业混音但未做过母带的歌曲,通常比同一首做完 -8 LUFS 限制的版本分离得更好。

这里「伴奏」到底指什么

demucs htdemucs_ft 是一个混合 Transformer,会把一首歌拆成四个内部声源——人声贝斯其他(吉他、键盘、合成器等不属于前三类的声音)。本工具使用的 --two-stems vocals 模式返回两条音轨:

  • 人声 — 模型对人声部分的预测。
  • 伴奏 — 原始歌曲减去人声预测后的结果。它是通过把人声从输入里减掉算出来的,所以某些频段听起来会「空」一点。这是正常的,也是所有 AI 去人声工具共同的取舍。

如果你需要更细粒度的音轨(只要鼓、只要贝斯等),完整的 demucs 模型对外提供这个选项;两音轨模式已经能覆盖绝大多数卡拉OK 和混音工作流的需求。

常见用途

  • 卡拉OK 伴奏 — 把伴奏音轨丢进你的卡拉OK 软件或 DJ 软件。
  • 清唱提取 用于混音、remix 和 bootleg。
  • 采样 — 从成品里抠出干净的人声或伴奏 loop,免去支付官方 remix 授权。
  • 练习与教学 — 跟伴奏演唱,再把自己的翻唱和原版清唱对比。
  • 音频修复 — 把人声单独抽出来做降噪或音高校正,不影响伴奏。

技术说明

模型在我们的服务器上以纯 CPU 模式运行。容器重启后的第一次请求会花 20–30 秒把 340 MB 的模型权重读进内存,之后的请求会立刻开始处理。单次任务超过服务器上限(当前 50 MB)的音频会被拒收——请先把长文件切分再上传。

人声分离能力由 GitHub Repository">demucs 提供,基于 MIT 协议由 Meta 开源。预训练 htdemucs_ft 权重版权归 Meta Platforms, Inc. 所有,并按相同协议从 Hugging Face Hub 重新分发。本工具在未修改的 demucs 之上叠加了上传界面、任务队列与 ZIP 打包逻辑。

常见问题

这个去人声工具是免费的吗?
是的——无需注册、无需付费、无水印。页面靠不显眼的广告维持,服务器成本由我们承担。
我的音频会上传或分享出去吗?
文件只在分离任务执行期间上传到我们的服务器,处理完会立刻删除。除了生成音轨所必需的步骤之外,我们不会存储、转码、分享或分析你的音频。
支持哪些音频格式?
MP3、WAV、FLAC、OGG、M4A、AAC、OPUS、WMA、AIFF 和 M4B。采样率自动归一化,位深保持不变。
能单独分离鼓、贝斯等乐器吗?
本工具不支持——底层模型被配置成最常见的「人声 vs 其他」两分法。完整的四音轨模式(人声、鼓、贝斯、其他)在 demucs 上游项目中可以启用,需要更细粒度控制请自行使用。
为什么第一次请求要等很久?
服务器重启后的第一次人声分离请求会花 20–30 秒把 340 MB 的 AI 模型读进内存,之后的请求会立刻开始处理。进度条在此期间显示「正在加载 AI 模型」,让你知道不是卡死了。
应该选 MP3 还是 WAV 输出?
MP3 体积小,适合卡拉OK 或日常听。WAV 是无压缩的,如果你打算在 DAW 里继续编辑音轨就选 WAV,因为有损压缩会留下能被后续处理继承的伪影。
分离一次要多久?
一首 3 分钟的歌曲在我们的 CPU 服务器上通常需要 60–180 秒。非常长的文件(超过 10 分钟)可能超过单次任务上限;需要更长的段落请先切分。
我的歌曲本来就是伴奏怎么办?
如果输入只有伴奏,「人声」音轨会是静音或接近静音的底噪,「伴奏」音轨会和输入完全一致。