Trenne Gesang und Instrumental aus jedem Song mit KI (demucs htdemucs_ft). Lade ein ZIP mit Gesangs- und Karaoke-Stem herunter.
Kostenloser KI-Gesangsentferner und Karaoke-Generator. Teile jeden Song direkt im Browser in einen sauberen Gesangs-Stem und einen Instrumental-Stem (Karaoke). Angetrieben von Metas Open-Source-Modell demucs (htdemucs_ft), derselben KI, die Tontechniker in der Musikproduktion verwenden. Kein Konto, kein Wasserzeichen — das Audio wird auf unseren Servern verarbeitet, die beiden Stems kommen in einem einzigen ZIP zurück.
Audiodatei auswählen oder hierher ziehen
Eine MP3/WAV/FLAC/M4A in das Feld ziehen, um zu starten
Hinweis: Dieses Tool lädt das Audio zur KI-Verarbeitung auf den Server hoch. Lade keine sensiblen Dateien hoch.
Die Verarbeitung langer Songs kann etwas dauern (KI-Modell auf CPU).
Über Gesangstrennung
Was ist Gesangstrennung?
Gesangstrennung (auch Gesang entfernen oder Stem-Separation) bezeichnet das Zerlegen eines fertigen Songs in zwei Teile: den Gesang (Gesang, Rap, Sprache) und das Instrumental (alles andere: Schlagzeug, Bass, Gitarren, Keyboards, Synths). Sie ist die Technologie, die Karaoke ohne Live-Band möglich macht, und erlaubt es Produzenten, Songs zu samplen, zu remixen oder zu covern, die nie als Einzelspuren veröffentlicht wurden.
Bis Ende der 2010er Jahre brauchte man entweder Zugriff auf die ursprünglichen Studio-Multitracks (selten) oder Phasen-Annulierungs-Tricks, die nur bei Mono-Aufnahmen funktionierten. Moderne KI-Modelle wie demucs nehmen einen fertig gemischten Song als Eingabe und erzeugen zwei saubere Stems — selbst bei starkem Hall, Sidechain-Kompression oder mehrschichtigem Hintergrundgesang.
So verwendest du dieses Tool
Audio vorbereiten. Jedes gängige Format funktioniert — MP3, WAV, FLAC, OGG, M4A, AAC, OPUS, WMA, AIFF oder M4B. Die Samplingrate wird automatisch normalisiert, die Bittiefe bleibt erhalten.
Datei in das Upload-Feld ziehen oder zum Durchsuchen klicken. Der Dateiname erscheint unter dem Feld.
Ausgabeformat wählen. Wähle MP3 für eine kompakte Datei, die auf jedem Gerät läuft, oder WAV für einen unkomprimierten Master, der sich in einer DAW weiterbearbeiten lässt.
Klick auf Trennen. Der Browser lädt die Datei auf unsere Server hoch, wo das KI-Modell (htdemucs_ft) sie verarbeitet. Der Fortschrittsbalken zeigt beim allerersten Aufruf einen Schritt "KI-Modell wird geladen", danach "Gesang und Instrumental werden getrennt", während der Song analysiert wird. Ein 3-Minuten-Song braucht typischerweise 60–180 Sekunden.
ZIP herunterladen. Klicke nach Abschluss auf ZIP herunterladen (Gesang + Instrumental), um ein Archiv mit beiden Stems zu speichern. Beide Stems behalten Tempo und Tonhöhe der Quelldatei — sie können direkt in ein Projekt gezogen werden.
Tipps für beste Ergebnisse
Verwende die hochwertigste Quelle, die du hast. Verlustbehaftete Formate wie 128 kbps MP3 erzeugen Störungen, die die KI nicht rückgängig machen kann. Eine 320-kbps-MP3-, AAC-, FLAC- oder WAV-Quelle klingt deutlich sauberer.
Kürzere Clips werden schneller und sauberer getrennt. Wenn du nur den Refrain oder eine Strophe brauchst, schneide die entsprechende Region vorher in deiner DAW heraus; das Modell analysiert die ganze Datei.
Mono ist in Ordnung. Die meisten Pop-, Rock- und Hip-Hop-Mischungen sind stereo, aber die KI verarbeitet Mono-Quellen ebenso zuverlässig.
Heavy Mastering ist dein Feind. Loudness-War-Tracks mit Brick-Wall-Limiting rauben dem Modell die räumlichen Hinweise, auf die es angewiesen ist. Ein professionell gemischter, aber ungemasterter Song wird für gewöhnlich deutlich besser getrennt als derselbe Song nach -8-LUFS-Limiting.
Was "Instrumental" hier konkret bedeutet
demucs htdemucs_ft ist ein Hybrid-Transformer, der einen Song in vier interne Quellen zerlegt: Gesang, Schlagzeug, Bass und Sonstiges (Gitarren, Keys, Synths, alles, was nicht Gesang, Schlagzeug oder Bass ist). Der Modus --two-stems vocals, den dieses Tool verwendet, liefert zwei Stems:
Gesang — die Gesangsvorhersage des Modells.
Instrumental — der Originalsong abzüglich der Gesangsvorhersage. Wird berechnet, indem der Gesang aus der Eingabe subtrahiert wird — daher klingt das Instrumental in manchen Frequenzen etwas "hohl". Das ist normal und der gleiche Kompromiss, den jeder KI-Gesangsentferner macht.
Wenn du feinere Stems brauchst (nur Schlagzeug, nur Bass usw.), stellt das vollständige demucs-Modell diese als separate Option bereit; der Zwei-Stem-Modus deckt die meisten Karaoke- und Remix-Workflows ab.
Häufige Einsatzbereiche
Karaoke-Backing-Tracks — Instrumental in deine Karaoke-App oder DJ-Software laden.
Acapella-Extraktion für Mashups, Remixe und Bootlegs.
Sampling — saubere Gesangs- oder Instrumental-Loops aus veröffentlichten Songs extrahieren, ohne offizielle Remix-Lizenz zu bezahlen.
Üben und Unterricht — zum Instrumental mitsingen und dein Cover mit dem Original-Acapella vergleichen.
Audio-Restauration — Gesang isolieren, um Rauschunterdrückung oder Tonhöhenkorrekturen vorzunehmen, ohne den Backing-Track zu berühren.
Technische Hinweise
Das Modell läuft auf unserem Server rein auf der CPU. Die erste Anfrage nach einem frischen Container-Start lädt etwa 20–30 Sekunden lang die 340 MB Modellgewichte in den Speicher; nachfolgende Anfragen starten sofort mit der Verarbeitung. Audio über dem pro Job erlaubten Limit (derzeit 50 MB) wird abgelehnt — lange Dateien vorher aufteilen.
Häufige Fragen
Ist dieser Gesangsentferner kostenlos?
Ja — kein Konto, keine Zahlung, kein Wasserzeichen. Die Seite finanziert sich über unaufdringliche Werbung; die Serverkosten tragen wir.
Wird mein Audio hochgeladen oder geteilt?
Die Datei wird nur für die Dauer des Trennungsauftrags auf unseren Server hochgeladen und unmittelbar danach gelöscht. Wir speichern, transcodieren, teilen oder analysieren dein Audio nicht über das hinaus, was zur Erzeugung der Stems nötig ist.
Welche Audioformate werden unterstützt?
MP3, WAV, FLAC, OGG, M4A, AAC, OPUS, WMA, AIFF und M4B. Die Samplingrate wird automatisch normalisiert, die Bittiefe bleibt erhalten.
Kann das Tool einzelne Instrumente wie Schlagzeug oder Bass trennen?
Nicht in diesem Tool — das zugrundeliegende Modell ist auf den häufigsten Anwendungsfall (Gesang vs. alles andere) eingestellt. Der vollständige Vier-Stem-Modus (Gesang, Schlagzeug, Bass, Sonstiges) ist im vorgelagerten demucs-Projekt verfügbar, falls du feinere Kontrolle brauchst.
Warum dauert die erste Anfrage so lange?
Die erste Gesangstrennungs-Anfrage nach einem frischen Server-Start lädt etwa 20–30 Sekunden lang die 340 MB des KI-Modells in den Speicher. Folgeanfragen starten sofort. Der Fortschrittsbalken zeigt während dieses Schritts "KI-Modell wird geladen", damit du weißt, dass es nicht hängt.
Sollte ich MP3 oder WAV als Ausgabe wählen?
MP3 ist viel kleiner und reicht für Karaoke oder gelegentliches Hören. WAV ist unkomprimiert und das, was du willst, wenn du die Stems weiter in einer DAW bearbeiten möchtest, denn verlustbehaftete Kompression hinterlässt Artefakte, die weitere Verarbeitungsschritte überleben.
Wie lange dauert eine Trennung?
Ein 3-Minuten-Song braucht auf unserem CPU-Server typischerweise 60–180 Sekunden. Sehr lange Dateien (über 10 Minuten) können das Per-Job-Limit überschreiten; teile die Datei vorher, wenn du längere Abschnitte brauchst.
Was passiert, wenn mein Song bereits ohne Gesang ist?
Wenn die Eingabe rein instrumental ist, ist der "Gesangs"-Stem stumm oder enthält fast nur Rauschen und der "Instrumental"-Stem ist identisch zur Eingabe.