Eliminador de Voz y Creador de Karaoke

Separa la voz y el acompañamiento de cualquier canción con IA (demucs htdemucs_ft). Descarga un ZIP con las pistas de voz y karaoke.

Eliminador de voz y creador de karaoke con IA, gratis. Divide cualquier canción en una pista limpia de voz y otra instrumental (karaoke) directamente en el navegador. Funciona con demucs (htdemucs_ft), el modelo de código abierto de Meta que usan los ingenieros de sonido. Sin cuenta, sin marca de agua: el audio se procesa en nuestros servidores y las dos pistas llegan en un único ZIP.

Elige un archivo de audio o arrástralo aquí
Suelta un MP3/WAV/FLAC/M4A en la caja para comenzar
Archivo seleccionado: -
Aviso: esta herramienta sube el audio al servidor para procesarlo con IA. No suba archivos sensibles.
El procesamiento puede tardar en canciones largas (modelo de IA basado en CPU).

Acerca de la separación de voz

¿Qué es la separación de voz?

La separación de voz (también llamada eliminación de voz o separación de pistas) es el proceso de dividir una canción terminada en dos partes: la voz (canto, rap o habla) y el instrumental (el resto: batería, bajo, guitarras, teclados, sintetizadores). Es la tecnología que hace posible el karaoke sin contratar una banda en directo, y permite a los productores muestrear, remezclar o versionar canciones que nunca se publicaron como pistas separadas.

Hasta finales de la década de 2010 esto requería acceso a las pistas multipista originales del estudio (algo muy raro) o trucos de cancelación de fase que solo funcionaban con grabaciones mono. Los modelos de IA modernos como demucs aceptan una canción totalmente mezclada como entrada y producen dos pistas limpias, incluso en temas con reverb intensa, compresión side-chain o coros en capas.

Cómo usar esta herramienta

  1. Prepara el audio. Cualquier formato común funciona: MP3, WAV, FLAC, OGG, M4A, AAC, OPUS, WMA, AIFF o M4B. La frecuencia de muestreo se normaliza automáticamente; la profundidad de bits se conserva.
  2. Suelta el archivo en el cuadro de subida o haz clic para examinar. El nombre del archivo aparecerá debajo del cuadro.
  3. Elige un formato de salida. Escoge MP3 para un archivo pequeño que puedas reproducir en cualquier dispositivo, o WAV para un máster sin comprimir adecuado para editar en un DAW.
  4. Haz clic en Separar. El navegador sube el archivo a nuestros servidores, donde el modelo de IA (htdemucs_ft) lo procesa. La barra de progreso muestra un paso "cargando el modelo de IA" la primera vez que uses la herramienta, luego "separando voz e instrumental" mientras se analiza la canción. Una canción de 3 minutos tarda típicamente entre 60 y 180 segundos.
  5. Descarga el ZIP. Cuando termine, haz clic en Descargar ZIP (voz + instrumental) para guardar un archivo que contiene las dos pistas. Ambas pistas comparten el tempo y el tono del archivo original: listas para añadirlas directamente a un proyecto.

Consejos para obtener los mejores resultados

  • Usa la fuente con la mayor calidad que tengas. Los formatos con pérdida como MP3 a 128 kbps introducen artefactos que la IA no puede deshacer. Una fuente MP3 a 320 kbps, AAC, FLAC o WAV sonará notablemente más limpia.
  • Los cortes más cortos se separan más rápido y mejor. Si solo necesitas un estribillo o una estrofa, recorta primero la región en tu DAW; el modelo analiza el archivo completo.
  • Mono funciona bien. La mayoría de las mezclas de pop, rock y hip-hop están en estéreo, pero la IA maneja fuentes mono igual de bien.
  • La masterización agresiva es tu enemiga. Las pistas afectadas por la guerra de la sonoridad y limitadas con brick-wall pierden las pistas espaciales que el modelo necesita. Una canción mezclada profesionalmente pero sin masterizar suele separarse mucho mejor que la misma canción tras una limitación a -8 LUFS.

Qué significa aquí "instrumental"

demucs htdemucs_ft es un transformador híbrido que divide una canción en cuatro fuentes internas: voces, batería, bajo y otros (guitarras, teclas, sintetizadores, todo lo que no sea voz, batería o bajo). El modo --two-stems vocals que usa esta herramienta devuelve dos pistas:

  • Voz — la predicción de voz del modelo.
  • Instrumental — la canción original menos la predicción de voz. Se calcula restando las voces de la entrada, por eso el instrumental puede sonar algo "hueco" en algunas frecuencias. Esto es normal y es el mismo compromiso que asume cualquier removedor de voz basado en IA.

Si necesitas pistas más detalladas (solo batería, solo bajo, etc.) el modelo demucs completo las expone como una opción aparte; el modo de dos pistas cubre la mayoría de los flujos de karaoke y remezcla.

Usos habituales

  • Pistas de karaoke — mete el instrumental en tu app de karaoke o software de DJ.
  • Extracción de acapella para mashups, remezclas y bootlegs.
  • Sampling — extrae un loop limpio de voz o instrumental de un tema publicado sin pagar un clearance oficial.
  • Práctica y enseñanza — canta con el instrumental y compara tu versión con el acapella original.
  • Restauración de audio — aís la voz para limpieza, reducción de ruido o corrección de tono sin tocar la pista de acompañamiento.

Notas técnicas

El modelo se ejecuta solo en CPU en nuestro servidor. La primera petición tras un arranque fresco del contenedor tarda unos 20–30 segundos en cargar los 340 MB de pesos del modelo en memoria; las peticiones siguientes empiezan a procesar de inmediato. Los audios que superen el límite por trabajo (actualmente 50 MB) serán rechazados: divide los archivos largos primero.

La separación de voz se basa en GitHub Repository">demucs, publicado por Meta bajo la licencia MIT. Los pesos preentrenados de htdemucs_ft son © Meta Platforms, Inc. y se redistribuyen desde Hugging Face Hub bajo la misma licencia. Esta herramienta añade la interfaz de subida, la cola de trabajos y el empaquetado ZIP sobre una instalación de demucs sin modificar.

Preguntas frecuentes

¿Este eliminador de voz es gratis?
Sí: sin cuenta, sin pagos, sin marca de agua. La página se sostiene con anuncios discretos y el coste del servidor lo asumimos nosotros.
¿Se sube o se comparte mi audio?
El archivo se sube a nuestro servidor solo durante la duración del trabajo de separación y se elimina inmediatamente después. No almacenamos, transcodificamos, compartimos ni analizamos tu audio más allá de lo necesario para producir las pistas.
¿Qué formatos de audio se admiten?
MP3, WAV, FLAC, OGG, M4A, AAC, OPUS, WMA, AIFF y M4B. La frecuencia de muestreo se normaliza automáticamente; la profundidad de bits se conserva.
¿Puede separar instrumentos individuales como batería o bajo?
No en esta herramienta: el modelo subyacente está configurado para el caso más común (voces frente al resto). El modo completo de cuatro pistas (voces, batería, bajo, otros) está disponible en el proyecto demucs original si necesitas un control más fino.
¿Por qué la primera petición tarda tanto?
La primera petición tras un arranque nuevo del servidor tarda unos 20–30 segundos en cargar los 340 MB del modelo de IA en memoria. Las peticiones siguientes comienzan de inmediato. La barra de progreso muestra "cargando el modelo de IA" durante ese paso para que sepas que no se ha quedado colgada.
¿Debería elegir MP3 o WAV?
MP3 es mucho más pequeño y es suficiente para karaoke o escucha casual. WAV no está comprimido y es lo que quieres si planeas editar las pistas en un DAW, ya que la compresión con pérdida añade artefactos que sobreviven al procesado posterior.
¿Cuánto tarda la separación?
Una canción de 3 minutos tarda típicamente entre 60 y 180 segundos en nuestro servidor CPU. Los archivos muy largos (más de 10 minutos) pueden superar el límite por trabajo; divide primero el archivo si necesitas segmentos más largos.
¿Qué pasa si mi canción ya no tiene voz?
Si la entrada es puramente instrumental, la pista de "voces" estará silenciosa o con un siseo casi imperceptible y la pista "instrumental" será idéntica a la entrada.