人聲分離與伴奏提取

使用 AI(demucs htdemucs_ft 模型)從任何歌曲中分離人聲與伴奏,一鍵下載包含人聲與伴奏音軌的 ZIP 壓縮檔。

免費 AI 人聲分離與卡拉OK 伴奏製作工具。 在瀏覽器中把任何歌曲一鍵拆成乾淨的人聲音軌與伴奏(卡拉OK)音軌。採用 Meta 開源的 demucs 模型(htdemucs_ft)——這是音訊工程師在音樂製作中實際依賴的同一套 AI。無需註冊、無浮水印,音訊在我們的伺服器上處理後,兩條音軌會打包到同一個 ZIP 中回傳。

選擇音訊檔案或將檔案拖曳至此
將 MP3/WAV/FLAC/M4A 檔案拖入此處即可開始
已選擇檔案: -
注意:本工具會將音訊上傳到伺服器進行 AI 處理,請勿上傳敏感檔案。
處理較長歌曲時可能需要一些時間(CPU 執行 AI 模型)。

關於人聲分離

什麼是人聲分離?

人聲分離(也叫去人聲或音軌分離)是把一首完整的歌曲拆成兩個部分:人聲(演唱、饒舌或說話)和伴奏(其餘所有樂器:鼓、貝斯、吉他、鍵盤、合成器等)。這是讓卡拉OK 不需要現場樂隊的技術基礎,也讓音樂製作人可以取樣、混音或翻唱從未單獨發行的歌曲。

在 2010 年代後期之前,這要嘛需要拿到原始錄音室的分軌檔案(極其罕見),要嘛只能靠反相技巧——而且只在單聲道錄音上有效。現代 AI 模型(例如 demucs)能直接把一首完整混音的歌曲作為輸入,輸出兩條乾淨的音軌,即使作品有大量殘響、側鏈壓縮或多層合聲也照樣能分離。

如何使用本工具

  1. 準備音訊。 任何常見格式都可以——MP3、WAV、FLAC、OGG、M4A、AAC、OPUS、WMA、AIFF 或 M4B。取樣率會自動歸一化,位元深度保持不變。
  2. 把檔案拖進 上方上傳框,或點擊瀏覽。檔名會顯示在上傳框下方。
  3. 選擇輸出格式。 選 MP3 得到體積小、所有裝置都能播放的檔案;選 WAV 得到適合在 DAW 中繼續編輯的未壓縮母帶。
  4. 點擊「開始分離」。 瀏覽器把檔案上傳到我們的伺服器,由 AI 模型(htdemucs_ft)處理。進度條會先顯示「正在載入 AI 模型」(首次使用才會出現),接著轉為「正在分離人聲與伴奏」。一首 3 分鐘的歌曲通常需要 60–180 秒。
  5. 下載 ZIP。 處理完成後,點擊「下載 ZIP(人聲 + 伴奏)」即可獲得一個壓縮檔,裡面是兩條音軌。兩條音軌的節奏與音高與原檔完全一致,可以直接拖進專案中用。

提升分離效果的幾個要點

  • 儘量用最高品質的來源檔案。 128 kbps MP3 這類有損格式會引入 AI 無法還原的雜訊。320 kbps MP3、AAC、FLAC 或 WAV 來源檔的清晰度會明顯更好。
  • 片段越短,效果越好、越快。 只需要副歌或主歌的話,先在 DAW 裡切出來;模型會對整段音訊做分析。
  • 單聲道也能用。 大多數流行、搖滾、嘻哈作品都是立體聲混音,但 AI 處理單聲道來源同樣出色。
  • 過度母帶是分離的大敵。 響度戰爭中被磚牆限制過的曲目會丟失模型所依賴的空間資訊。專業混音但未做過母帶的歌曲,通常比同一首做完 -8 LUFS 限制的版本分離得更好。

這裡「伴奏」到底指什麼

demucs htdemucs_ft 是一個混合 Transformer,會把一首歌拆成四個內部聲源——人聲、鼓、貝斯、其他(吉他、鍵盤、合成器等不屬於前三類的聲音)。本工具使用的 --two-stems vocals 模式回傳兩條音軌:

  • 人聲 — 模型對人聲部分的預測。
  • 伴奏 — 原始歌曲減去人聲預測後的結果。它是透過把人聲從輸入中減去算出來的,所以某些頻段聽起來會「空」一點。這是正常的,也是所有 AI 去人聲工具共同的取捨。

如果你需要更細粒度的音軌(只要鼓、只要貝斯等),完整的 demucs 模型對外提供這個選項;兩音軌模式已經能涵蓋絕大多數卡拉OK與混音工作流的需求。

常見用途

  • 卡拉OK 伴奏 — 把伴奏音軌丟進你的卡拉OK 軟體或 DJ 軟體。
  • 清唱提取 用於混音、remix 與 bootleg。
  • 取樣 — 從成品裡摳出乾淨的人聲或伴奏 loop,免去支付官方 remix 授權。
  • 練習與教學 — 跟伴奏演唱,再把自己的翻唱和原版清唱對比。
  • 音訊修復 — 把人聲單獨抽出來做降噪或音高校正,不影響伴奏。

技術說明

模型在我們的伺服器上以純 CPU 模式執行。容器重啟後的第一次請求會花 20–30 秒把 340 MB 的模型權重讀進記憶體,之後的請求會立刻開始處理。單次任務超過伺服器上限(目前 50 MB)的音訊會被拒收——請先把長檔案切分再上傳。

人聲分離能力由 GitHub Repository">demucs 提供,基於 MIT 授權由 Meta 開源。預訓練 htdemucs_ft 權重版權歸 Meta Platforms, Inc. 所有,並按相同授權從 Hugging Face Hub 重新分發。本工具在未修改的 demucs 之上疊加上傳介面、工作佇列與 ZIP 打包邏輯。

常見問題

這個去人聲工具是免費的嗎?
是的——無需註冊、無需付費、無浮水印。頁面靠不顯眼的廣告維持,伺服器成本由我們承擔。
我的音訊會被上傳或分享出去嗎?
檔案只在分離任務執行期間上傳到我們的伺服器,處理完會立刻刪除。除了產生音軌所必需的步驟之外,我們不會儲存、轉碼、分享或分析你的音訊。
支援哪些音訊格式?
MP3、WAV、FLAC、OGG、M4A、AAC、OPUS、WMA、AIFF 與 M4B。取樣率自動歸一化,位元深度保持不變。
能單獨分離鼓、貝斯等樂器嗎?
本工具不支援——底層模型被設定成最常見的「人聲 vs 其他」兩分法。完整的四音軌模式(人聲、鼓、貝斯、其他)在 demucs 上游專案中可啟用,需要更細粒度控制請自行使用。
為什麼第一次請求要等很久?
伺服器重啟後的第一次人聲分離請求會花 20–30 秒把 340 MB 的 AI 模型讀進記憶體,之後的請求會立刻開始處理。進度條在此期間顯示「正在載入 AI 模型」,讓你知道不是卡死了。
應該選 MP3 還是 WAV 輸出?
MP3 體積小,適合卡拉OK 或日常聆聽。WAV 是未壓縮的,如果你打算在 DAW 中繼續編輯音軌就選 WAV,因為有損壓縮會留下能被後續處理繼承的雜訊。
分離一次要多久?
一首 3 分鐘的歌曲在我們的 CPU 伺服器上通常需要 60–180 秒。非常長的檔案(超過 10 分鐘)可能超過單次任務上限;需要更長的段落請先切分。
我的歌曲本來就是伴奏怎麼辦?
如果輸入只有伴奏,「人聲」音軌會是靜音或接近靜音的底噪,「伴奏」音軌會和輸入完全一致。