ボーカル除去・カラオケ作成ツール

AI(demucs htdemucs_ft)で任意の楽曲からボーカルと伴奏を分離。ボーカルとカラオケ用のインストゥルメンタルをZIPでダウンロードできます。

無料のAIボーカル除去・カラオケメーカー。 ブラウザ上で任意の楽曲をクリーンなボーカルトラックとインストゥルメンタル(カラオケ)トラックに分離します。Metaのオープンソースモデルdemucs(htdemucs_ft)を採用——音楽制作の現場で実際に使われているAIと同じものです。アカウント不要、ウォーターマークなし。オーディオは当方のサーバーで処理され、2つのトラックを1つのZIPで配信します。

オーディオファイルを選択、またはここにドロップ
MP3/WAV/FLAC/M4A をボックスにドロップしてください
選択中のファイル: -
注意:本ツールはオーディオをサーバーへアップロードしてAI処理を行います。機密性の高いファイルはアップロードしないでください。
長い楽曲の処理には時間がかかります(CPUベースのAIモデル)。

ボーカル分離について

ボーカル分離とは?

ボーカル分離(ボーカルリムーバーまたはステム分離とも呼ばれます)は、完成した楽曲を2つのパートに分ける処理です。ボーカル(歌唱、ラップ、話し声)とインストゥルメンタル(その他すべて——ドラム、ベース、ギター、キーボード、シンセサイザーなど)。ライブバンドなしでカラオケを実現する技術であり、制作側はマルチトラックが公開されていない楽曲でもサンプリング、リミックス、カバーできます。

2010年代後半までは、元のスタジオマルチトラックにアクセスする(稀)か、モノラル録音でしか機能しない位相キャンセル tricksに頼る必要がありました。demucsのような現代AIモデルは、完全にミックスされた楽曲を入力として受け取り、リバーブ・サイドチェーン圧縮・多層ハモリが重なるトラックからでも2つのクリーンなステムを出力できます。

本ツールの使い方

  1. オーディオを準備します。 一般的なフォーマットならどれでも動作します——MP3、WAV、FLAC、OGG、M4A、AAC、OPUS、WMA、AIFF、M4B。サンプルレートは自動で正規化、ビット深度は保持されます。
  2. 上のアップロードボックスにファイルをドロップ、またはクリックして参照選択。ファイル名はボックスの下に表示されます。
  3. 出力形式を選びます。 MP3ならファイルサイズが小さくあらゆるデバイスで再生可能、WAVならDAWでさらに編集するための非圧縮マスターが得られます。
  4. 「分離する」をクリック。 ブラウザがファイルをサーバーにアップロードし、AIモデル(htdemucs_ft)が処理します。初回利用時はプログレスバーに「AIモデルを読み込み中」と表示されますが、それ以降は「ボーカルと伴奏を分離しています」に切り替わります。3分の楽曲で通常60〜180秒です。
  5. ZIPをダウンロード。 完了したら「ZIPをダウンロード(ボーカル + インストゥルメンタル)」をクリックし、2つのトラックを含むZIPアーカイブを保存します。テンポとピッチは元ファイルと一致しているので、そのままプロジェクトにドロップできます。

より良い結果を得るために

  • 最高品質のソースを使ってください。 128 kbps MP3のような非可逆形式はAIで除去できないアーティファクトを持ち込みます。320 kbps MP3、AAC、FLAC、WAVのソースは明らかにクリアです。
  • 短いクリップほど速く・正確に分離されます。 サビや verse だけが必要なら、まずDAWで該当部分を切り出してください。モデルはファイル全体を解析します。
  • モノラルも対応します。 ポップス、ロック、ヒップホップの多くはステレオですが、AIはモノラルソースも同じように扱えます。
  • 過度なマスタリングは敵です。 ラウドネス戦争でブリックウォールリミッティングされたトラックは、モデルが頼る空間的手がかりを失います。-8 LUFSリミッティング後の同じ楽曲より、プロのマスタリングされていないミックスの方が分離結果が良い傾向があります。

ここでの「インストゥルメンタル」の意味

demucs htdemucs_ftは4つの内部ソース(ボーカルドラムベースその他)に楽曲を分解するハイブリッド Transformerです。本ツールが使う--two-stems vocalsモードは2つのステムを返します。

  • ボーカル — モデルによるボーカル予測。
  • インストゥルメンタル — 入力からボーカル予測を引いたもの。ボーカル成分を入力から減算して算出するため、一部の周波数帯域が「空洞」に聞こえます。これは正常で、すべてのAIボーカルリムーバーが持つトレードオフと同じです。

より細かいステム(ドラムのみ、ベースのみなど)が必要な場合は、完全なdemucsモデルが個別のオプションとして公開しています。2ステムモードはカラオケやリミックスの大半のワークフローで十分です。

主な用途

  • カラオケ用バッキングトラック — インストゥルメンタルをカラオケアプリやDJソフトウェアへ。
  • アカペラ抽出 — マッシュアップ、リミックス、ブートレッグ用。
  • サンプリング — リリース済みの楽曲からクリーンなボーカルまたはインストゥルメンタルのループを抽出。公式リミックスの許諾料不要。
  • 練習・指導 — インストゥルメンタルに合わせて歌い、自分のカバーとオリジナルアカペラを比較。
  • オーディオ修復 — ボーカルだけを分離し、伴奏に影響せずノイズ除去・ピッチ補正。

技術ノート

モデルは当方のサーバー上でCPUのみで動作します。コンテナ再起動後の最初のリクエストは約20〜30秒かけて340 MBのモデル重みをメモリへ読み込みます。それ以降のリクエストはすぐに処理を開始します。サーバーの1ジョブ上限(現在50 MB)を超えるオーディオは拒否されます——必要なら先に分割してください。

ボーカル分離はGitHub Repository">demucs によって実現されています。Meta により MIT ライセンスで公開されています。事前学習済み htdemucs_ft 重みの著作権は Meta Platforms, Inc. に帰属し、同じライセンスの下で Hugging Face Hub から再配布されています。本ツールは未改変の demucs の上に、アップロードUI、ジョブキュー、ZIPパッケージを追加しています。

よくある質問

このボーカルリムーバーは無料ですか?
はい——アカウント不要、支払い不要、ウォーターマークなし。ページは控えめな広告で運営されており、サーバーコストは当方で負担しています。
アップロードしたオーディオは共有されますか?
ファイルは分離ジョブの実行中のみサーバーにアップロードされ、完了後すぐに削除されます。ステム生成に必要な処理以外に、保存・変換・共有・解析は一切行いません。
対応しているオーディオ形式は?
MP3、WAV、FLAC、OGG、M4A、AAC、OPUS、WMA、AIFF、M4B。サンプルレートは自動正規化、ビット深度は保持されます。
ドラムやベースなど個別の楽器を分離できますか?
本ツールでは非対応です——基盤モデルが最も一般的なユースケース(ボーカル対その他)に設定されています。完全な4ステムモード(ボーカル、ドラム、ベース、その他)は上流のdemucsプロジェクトで利用可能です。
最初のリクエストが遅いのはなぜ?
サーバー起動後の最初の人声分離リクエストは約20〜30秒かけて340 MBのAIモデルをメモリへ読み込みます。それ以降のリクエストは即座に処理を開始します。プログレスバーにはこのステップで「AIモデルを読み込み中」と表示されるため、停止していないことが分かります。
MP3とWAVどちらを選ぶべき?
MP3はサイズが小さく、カラオケやカジュアル視聴に適しています。WAVは非圧縮で、DAWでさらに編集する前提ならこちらを選んでください。可逆圧縮は後段の処理にも残るアーティファクトを加えます。
分離にはどれくらい時間がかかりますか?
3分の楽曲で当方のCPUサーバー上、通常60〜180秒です。10分を超える長いファイルは1ジョブ上限を超える可能性がありますので、先に分割してください。
元からインストゥルメンタルの楽曲を処理するとどうなりますか?
入力が純粋なインストゥルメンタルの場合、「ボーカル」ステムは無音またはほぼ無音のノイズ、「インストゥルメンタル」ステムは入力と同一になります。