人聲分離與伴奏提取
使用 AI(demucs htdemucs_ft 模型)從任何歌曲中分離人聲與伴奏,一鍵下載包含人聲與伴奏音軌的 ZIP 壓縮檔。
免費 AI 人聲分離與卡拉OK 伴奏製作工具。 在瀏覽器中把任何歌曲一鍵拆成乾淨的人聲音軌與伴奏(卡拉OK)音軌。採用 Meta 開源的 demucs 模型(htdemucs_ft)——這是音訊工程師在音樂製作中實際依賴的同一套 AI。無需註冊、無浮水印,音訊在我們的伺服器上處理後,兩條音軌會打包到同一個 ZIP 中回傳。
0%
使用 AI(demucs htdemucs_ft 模型)從任何歌曲中分離人聲與伴奏,一鍵下載包含人聲與伴奏音軌的 ZIP 壓縮檔。
免費 AI 人聲分離與卡拉OK 伴奏製作工具。 在瀏覽器中把任何歌曲一鍵拆成乾淨的人聲音軌與伴奏(卡拉OK)音軌。採用 Meta 開源的 demucs 模型(htdemucs_ft)——這是音訊工程師在音樂製作中實際依賴的同一套 AI。無需註冊、無浮水印,音訊在我們的伺服器上處理後,兩條音軌會打包到同一個 ZIP 中回傳。
0%
人聲分離(也叫去人聲或音軌分離)是把一首完整的歌曲拆成兩個部分:人聲(演唱、饒舌或說話)和伴奏(其餘所有樂器:鼓、貝斯、吉他、鍵盤、合成器等)。這是讓卡拉OK 不需要現場樂隊的技術基礎,也讓音樂製作人可以取樣、混音或翻唱從未單獨發行的歌曲。
在 2010 年代後期之前,這要嘛需要拿到原始錄音室的分軌檔案(極其罕見),要嘛只能靠反相技巧——而且只在單聲道錄音上有效。現代 AI 模型(例如 demucs)能直接把一首完整混音的歌曲作為輸入,輸出兩條乾淨的音軌,即使作品有大量殘響、側鏈壓縮或多層合聲也照樣能分離。
demucs htdemucs_ft 是一個混合 Transformer,會把一首歌拆成四個內部聲源——人聲、鼓、貝斯、其他(吉他、鍵盤、合成器等不屬於前三類的聲音)。本工具使用的 --two-stems vocals 模式回傳兩條音軌:
如果你需要更細粒度的音軌(只要鼓、只要貝斯等),完整的 demucs 模型對外提供這個選項;兩音軌模式已經能涵蓋絕大多數卡拉OK與混音工作流的需求。
模型在我們的伺服器上以純 CPU 模式執行。容器重啟後的第一次請求會花 20–30 秒把 340 MB 的模型權重讀進記憶體,之後的請求會立刻開始處理。單次任務超過伺服器上限(目前 50 MB)的音訊會被拒收——請先把長檔案切分再上傳。