人声分离与伴奏提取
使用 AI(demucs htdemucs_ft 模型)从任意歌曲中分离人声与伴奏,一键下载包含人声和伴奏音轨的 ZIP 压缩包。
免费 AI 人声分离与卡拉OK伴奏制作工具。 在浏览器中把任意歌曲一键拆分为干净的人声音轨与伴奏(卡拉OK)音轨。基于 Meta 开源的 demucs 模型(htdemucs_ft)——这是音频工程师在音乐制作中实际依赖的同一套 AI。无需注册、无水印,音频在我们服务器上处理后,两个音轨会打包到同一个 ZIP 中返回。
0%
使用 AI(demucs htdemucs_ft 模型)从任意歌曲中分离人声与伴奏,一键下载包含人声和伴奏音轨的 ZIP 压缩包。
免费 AI 人声分离与卡拉OK伴奏制作工具。 在浏览器中把任意歌曲一键拆分为干净的人声音轨与伴奏(卡拉OK)音轨。基于 Meta 开源的 demucs 模型(htdemucs_ft)——这是音频工程师在音乐制作中实际依赖的同一套 AI。无需注册、无水印,音频在我们服务器上处理后,两个音轨会打包到同一个 ZIP 中返回。
0%
人声分离(也叫去人声或音轨分离)是把一首完整的歌曲拆成两个部分:人声(演唱、说唱或讲话)和伴奏(其余所有乐器:鼓、贝斯、吉他、键盘、合成器等)。这是卡拉OK 不需要现场乐乐队的技术基础,也让音乐制作人可以采样、重混或翻唱从未单独发行的歌曲。
在 2010 年代后期之前,这要么需要拿到原始录音棚的分轨文件(极其罕见),要么只能靠反相技巧——而且只在单声道录音上有效。现代 AI 模型(例如 demucs)能直接把一首完整混音的歌曲作为输入,输出两条干净的音轨,哪怕作品有大量混响、侧链压缩或多层伴唱也照样能分离。
demucs htdemucs_ft 是一个混合 Transformer,会把一首歌拆成四个内部声源——人声、鼓、贝斯、其他(吉他、键盘、合成器等不属于前三类的声音)。本工具使用的 --two-stems vocals 模式返回两条音轨:
如果你需要更细粒度的音轨(只要鼓、只要贝斯等),完整的 demucs 模型对外提供这个选项;两音轨模式已经能覆盖绝大多数卡拉OK 和混音工作流的需求。
模型在我们的服务器上以纯 CPU 模式运行。容器重启后的第一次请求会花 20–30 秒把 340 MB 的模型权重读进内存,之后的请求会立刻开始处理。单次任务超过服务器上限(当前 50 MB)的音频会被拒收——请先把长文件切分再上传。