Séparez la voix et l'instrumental de n'importe quelle chanson grâce à l'IA (demucs htdemucs_ft). Téléchargez un ZIP contenant les pistes voix et karaoké.
Séparateur de voix IA et créateur de karaoké, gratuit. Découpez n'importe quelle chanson en une piste voix propre et une piste instrumentale (karaoké) directement dans le navigateur. Propulsé par demucs (htdemucs_ft), le modèle open source de Meta utilisé par les ingénieurs du son en production musicale. Pas de compte, pas de filigrane : l'audio est traité sur nos serveurs et les deux pistes arrivent dans un seul ZIP.
Choisissez un fichier audio ou déposez-le ici
Déposez un MP3/WAV/FLAC/M4A dans la zone pour démarrer
Remarque : cet outil téléverse l'audio sur le serveur pour traitement par IA. Ne téléversez pas de fichiers sensibles.
Le traitement peut prendre du temps pour les chansons longues (modèle d'IA sur CPU).
À propos de la séparation de voix
Qu'est-ce que la séparation de voix ?
La séparation de voix (aussi appelée suppression de voix ou séparation de pistes) consiste à découper une chanson terminée en deux parties : la voix (chant, rap, parole) et l'instrumental (tout le reste : batterie, basse, guitares, claviers, synthét). C'est la technologie qui permet le karaoké sans groupe live, et qui permet aux producteurs d'échantillonner, remixer ou reprendre des chansons qui n'ont jamais été publiées en pistes séparées.
Jusqu'à la fin des années 2010, il fallait soit accéder aux multipistes studio d'origine (rare), soit utiliser des astuces d'annulation de phase qui ne fonctionnaient qu'en mono. Les modèles d'IA modernes comme demucs prennent une chanson entièrement mixée en entrée et produisent deux pistes propres, même sur des morceaux avec beaucoup de réverb, de la compression side-chain ou des chœurs en couches.
Comment utiliser cet outil
Préparez l'audio. N'importe quel format courant fonctionne — MP3, WAV, FLAC, OGG, M4A, AAC, OPUS, WMA, AIFF ou M4B. La fréquence d'échantillonnage est normalisée automatiquement ; la profondeur de bits est préservée.
Déposez le fichier dans la zone de téléversement ci-dessus, ou cliquez pour parcourir. Le nom du fichier apparaît sous la zone.
Choisissez un format de sortie. Choisissez MP3 pour un petit fichier lisible sur tout appareil, ou WAV pour un master non compressé adapté à un montage en DAW.
Cliquez sur Séparer. Le navigateur téléverse le fichier sur nos serveurs, où le modèle d'IA (htdemucs_ft) le traite. La barre de progression affiche une étape « chargement du modèle d'IA » lors de la toute première utilisation, puis « séparation voix/instrumental en cours » pendant l'analyse de la chanson. Une chanson de 3 minutes prend typiquement 60 à 180 secondes.
Téléchargez le ZIP. Une fois le travail terminé, cliquez sur Télécharger le ZIP (voix + instrumental) pour enregistrer une archive contenant les deux pistes. Les deux pistes conservent le tempo et la tonalité du fichier source : elles sont prêtes à être déposées directement dans un projet.
Conseils pour de meilleurs résultats
Utilisez la source de la meilleure qualité possible. Les formats avec perte comme le MP3 128 kbps introduisent des artefacts que l'IA ne peut pas annuler. Une source MP3 320 kbps, AAC, FLAC ou WAV sera sensiblement plus propre.
Les clips plus courts se séparent plus vite et mieux. Si vous n'avez besoin que d'un refrain ou d'un couplet, découpez d'abord la région concernée dans votre DAW ; le modèle analyse le fichier entier.
Le mono convient. La plupart des productions pop, rock et hip-hop sont en stéréo, mais l'IA traite les sources mono aussi bien.
Le mastering agressif est votre ennemi. Les morceaux affectés par la guerre de la loudness, limités en brick wall, privent le modèle des indices spatiaux sur lesquels il s'appuie. Un morceau mixé professionnellement mais non masterisé se sépare souvent bien mieux que ce même morceau après un limiting à -8 LUFS.
Ce que « instrumental » signifie ici
demucs htdemucs_ft est un transformer hybride qui décompose une chanson en quatre sources internes — voix, batterie, basse et autres (guitares, claviers, synthés, tout ce qui n'est pas voix, batterie ou basse). Le mode --two-stems vocals utilisé par cet outil renvoie deux pistes :
Voix — la prédiction vocale du modèle.
Instrumental — la chanson d'origine moins la prédiction vocale. Calculée en soustrayant les voix de l'entrée, c'est pourquoi l'instrumental peut paraître un peu « creux » dans certaines fréquences. C'est normal et c'est le même compromis que fait tout suppresseur de voix par IA.
Si vous avez besoin de pistes plus fines (batterie seule, basse seule, etc.), le modèle demucs complet les expose comme une option séparée ; le mode deux pistes couvre la plupart des besoins en karaoké et remix.
Usages courants
Backings karaoké — déposez l'instrumental dans votre appli karaoké ou votre logiciel de DJ.
Extraction d'acapella pour mashups, remix et bootlegs.
Sampling — extrayez une boucle propre de voix ou d'instrumental à partir d'un morceau déjà publié, sans payer de clearance officielle.
Pratique et enseignement — chantez sur l'instrumental puis comparez votre reprise à l'acapella d'origine.
Restauration audio — isolez la voix pour la nettoyer, réduire le bruit ou corriger la hauteur sans toucher au backing.
Notes techniques
Le modèle tourne uniquement sur CPU sur notre serveur. La première requête après un redémarrage frais du conteneur passe environ 20 à 30 secondes à charger les 340 Mo de poids du modèle en mémoire ; les requêtes suivantes démarrent le traitement immédiatement. Les fichiers dépassant la limite par travail (actuellement 50 Mo) sont rejetés — découpez les longs fichiers au préalable.
Questions fréquentes
Ce séparateur de voix est-il gratuit ?
Oui — pas de compte, pas de paiement, pas de filigrane. La page est financée par des publicités discrètes et le coût du serveur est pris en charge par nos soins.
Mon audio est-il téléversé ou partagé ?
Le fichier est téléversé sur notre serveur uniquement le temps du travail de séparation, puis supprimé immédiatement. Nous ne stockons, transcodons, partageons ni analysons votre audio au-delà de ce qui est nécessaire pour produire les pistes.
Quels formats audio sont pris en charge ?
MP3, WAV, FLAC, OGG, M4A, AAC, OPUS, WMA, AIFF et M4B. La fréquence d'échantillonnage est normalisée automatiquement ; la profondeur de bits est préservée.
Peut-il séparer des instruments individuels comme la batterie ou la basse ?
Pas dans cet outil — le modèle sous-jacent est configuré pour le cas d'usage le plus courant (voix versus tout le reste). Le mode quatre pistes complet (voix, batterie, basse, autres) est disponible dans le projet demucs en amont si vous avez besoin d'un contrôle plus fin.
Pourquoi la première requête prend-elle autant de temps ?
La première requête après un redémarrage frais du serveur passe environ 20 à 30 secondes à charger les 340 Mo du modèle d'IA en mémoire. Les requêtes suivantes démarrent immédiatement. La barre de progression affiche « chargement du modèle d'IA » pendant cette étape pour que vous sachiez que ce n'est pas bloqué.
Dois-je choisir MP3 ou WAV en sortie ?
MP3 est bien plus petit et convient pour le karaoké ou une écoute occasionnelle. WAV est non compressé et est ce qu'il vous faut si vous prévoyez d'éditer les pistes dans un DAW, car la compression avec perte ajoute des artefacts qui survivent aux traitements ultérieurs.
Combien de temps prend la séparation ?
Une chanson de 3 minutes prend typiquement entre 60 et 180 secondes sur notre serveur CPU. Les fichiers très longs (au-delà de 10 minutes) peuvent dépasser la limite par travail ; découpez le fichier au préalable si vous avez besoin de segments plus longs.
Que se passe-t-il si ma chanson est déjà sans voix ?
Si l'entrée est purement instrumentale, la piste « voix » sera silencieuse ou un souffle à peine audible, et la piste « instrumental » sera identique à l'entrée.