- Por qué importa la clonación de voz sin conexión
- Tabla comparativa rápida
- Chatterbox: velocidad y control emocional
- OpenVoice: flexibilidad y clonación entre idiomas sin entrenamiento previo
- XTTS v2: amplitud y sencillez
- Cara a cara: las contrapartidas clave
- Ética de la clonación de voz: lo que hay que saber
- Recomendaciones de hardware e instalación
- Veredicto: qué herramienta para qué caso
- Preguntas frecuentes
- Reflexiones finales
Nota legal: El audio sintético generado por IA debe etiquetarse conforme al art. 50 del Reglamento europeo de IA, y clonar la voz de una persona real sin su consentimiento puede vulnerar leyes nacionales de imagen, personalidad y protección de datos (LO 1/1982 ES, KUG §22 DE, art. 9 CC FR, art. 79 CC PT, además del RGPD para la muestra de voz). Este artículo describe cómo funciona la tecnología para investigación legítima, accesibilidad y casos de uso consentidos — no para suplantación de identidad.
Por qué importa la clonación de voz sin conexión
Clonar una voz ha significado tradicionalmente usar API en la nube: enviar tu audio a un servidor, esperar el procesamiento y preocuparte por dónde acaban tus datos. Para quien crea, programa o investiga, eso genera fricción — y riesgo.
Las herramientas sin conexión cambian esa ecuación. Se ejecutan en local, en tu hardware, tus muestras de voz nunca salen de tu máquina y la inferencia ocurre al instante, sin coste de API ni esperas de ancho de banda. La contrapartida: gestionas tú las dependencias, el presupuesto de VRAM y los pesos de los modelos.
Tres herramientas se han destacado: Chatterbox (rápida, con control de emoción), OpenVoice (clonación multilingüe sin entrenamiento previo) y XTTS v2 (soporte de 16 idiomas, inferencia directa). Cada una toma un camino distinto.
Tabla comparativa rápida
| Tool | VRAM necesaria | Muestra de voz | Idiomas | Calidad | Licencia |
|---|---|---|---|---|---|
| Chatterbox | 4–8 GB | 5 seconds | English only | Excellent | Open source |
| OpenVoice | 8+ GB | 1 second | 6 nativos + sin entrenamiento previo | Very good | MIT |
| XTTS v2 | 4+ GB | 6 seconds | 16 languages | Good | Open source |
Chatterbox: velocidad y control emocional
Qué es: Chatterbox es el modelo de texto a voz de código abierto de Resemble AI, que combina síntesis de voz de alta fidelidad con clonación instantánea. La variante más reciente, Chatterbox-Turbo, usa una arquitectura simplificada de 350 millones de parámetros, lo que la convierte en una de las opciones más rápidas disponibles.
Cómo clona la voz: Le das un clip de referencia de 5 segundos. Chatterbox extrae las características de la voz y las aplica a cualquier texto que sintetices. El modelo admite exageración emocional — sube o baja la expresividad según tu caso, ya sea un personaje de videojuego, la narración de un pódcast o un diálogo animado.
Encaje de hardware: Chatterbox-Turbo logra una latencia de inferencia por debajo de 200 ms en hardware modesto. Apunta a entre 4 y 8 GB de VRAM para trabajar cómodo, aunque la inferencia solo con CPU es posible si aceptas una generación más lenta.
Idiomas: Solo inglés. No es un impedimento para muchos flujos de trabajo, pero descarta de entrada los proyectos multilingües.
Instalación: Con pip y el ecosistema estándar de Coqui TTS. API de Python sencilla o interfaz web. La comunidad ha publicado implementaciones de servidor autoalojado compatibles con el formato de API de OpenAI, útiles si lo integras en sistemas existentes.
Cuándo elegirla: Necesitas clonación rápida y expresiva en un solo idioma; el control de la emoción importa; trabajas con GPU de consumo.
OpenVoice: flexibilidad y clonación entre idiomas sin entrenamiento previo
Qué es: Desarrollada por el MIT y MyShell AI, OpenVoice es una herramienta de control de estilo de voz pensada para clonar al instante entre idiomas. Separa el timbre de la voz de los atributos de estilo — emoción, acento, ritmo — dando control fino sobre qué se conserva de la voz de referencia.
Cómo clona la voz: OpenVoice necesita solo 1 segundo de audio de referencia (menos que sus competidoras). Extrae dos representaciones: el timbre (la firma reconocible de quien habla) y el estilo (emoción, velocidad, acento). Puedes clonar el timbre a un idioma nuevo y ajustar el estilo por separado si quieres. Esa capacidad «entre idiomas y sin entrenamiento previo» destaca: clonar una voz inglesa hablando francés sin haber entrenado con hablantes de francés.
Encaje de hardware: Requiere 8 GB de RAM como mínimo; se recomienda mucho la aceleración por GPU (CUDA). Consume más VRAM que Chatterbox, pero menos que otras alternativas.
Idiomas: Seis de forma nativa (inglés, español, francés, chino, japonés y coreano). Más allá de esos, la clonación sin entrenamiento previo extiende el modelo a cualquier idioma, aunque la calidad se degrada de forma progresiva.
Instalación: Disponible en GitHub con documentación completa. Existen las versiones V1 y V2; la V2 usa mejores estrategias de entrenamiento para dar mejor calidad de audio. La licencia MIT permite uso comercial gratuito.
Nota sobre la licencia: OpenVoice está licenciada explícitamente para proyectos comerciales. Es algo inusual en modelos académicos y valioso si construyes productos.
Cuándo elegirla: Necesitas soporte multilingüe; tu audio de referencia es corto; quieres ajustar el estilo aparte del timbre; estás construyendo un producto comercial.
XTTS v2: amplitud y sencillez
Qué es: XTTS v2 es el modelo de texto a voz entre idiomas de Coqui, parte de la madura biblioteca Coqui TTS. Es el caballo de batalla: estable, bien documentado y con la mayor cobertura de idiomas de las opciones aquí.
Cómo clona la voz: Le das una muestra de 6 segundos de habla clara (idealmente sin ruido de fondo). XTTS v2 hace adaptación de hablante — aprende las características de quien habla y las aplica durante la síntesis. Simple, fiable, sin controles especiales de emoción o estilo.
Encaje de hardware: Requiere 4 GB o más de VRAM. Uno de los requisitos más modestos aquí. La opción por CPU es más lenta pero viable.
Idiomas: 16 de serie: inglés, español, francés, alemán, italiano, portugués, polaco, turco, ruso, neerlandés, checo, árabe, chino, japonés, húngaro y coreano. Cubre la mayoría de los casos habituales con una sola herramienta.
Instalación: Con pip (forma parte del paquete TTS). Documentación madura y muchos ejemplos de la comunidad. Se puede usar por línea de comandos, con la API de Python o por interfaz web.
Cuándo elegirla: Necesitas 16 idiomas sin concesiones; la simplicidad y la estabilidad pesan más que los controles avanzados; estás montando un producto mínimo viable o una prueba de concepto.
Cara a cara: las contrapartidas clave
Calidad de audio
Chatterbox y OpenVoice superan por poco a XTTS v2 en naturalidad percibida. Chatterbox brilla sobre todo en síntesis expresiva (voces de personaje, narración); OpenVoice destaca conservando la identidad de quien habla entre idiomas. XTTS v2 da un resultado sólido e inteligible, pero con menos finura prosódica. Las pruebas de escucha importan — descarga muestras de cada proyecto y decide con tu propio oído.
Audio de referencia necesario
El mínimo de 1 segundo de OpenVoice es generoso. Los 5 segundos que pide Chatterbox son lo estándar. XTTS v2 prefiere 6 segundos, pero acepta clips más cortos con menos calidad. Si trabajas con material de archivo o limitado, gana OpenVoice.
Alcance de idiomas
XTTS v2 cubre más idiomas. OpenVoice maneja seis de forma nativa más los que alcanza sin entrenamiento previo (útil pero menos predecible). Chatterbox solo habla inglés, una limitación seria si necesitas salida multilingüe. Si localizas para varios mercados, XTTS v2 es la opción por defecto.
Velocidad de inferencia
Chatterbox-Turbo es la más rápida (por debajo de 200 ms por enunciado). OpenVoice queda en medio. XTTS v2 es la más lenta, pero sigue siendo práctica. Si la interacción en tiempo real o la velocidad de procesamiento por lotes es crítica, gana Chatterbox.
Coste de hardware
XTTS v2 pide la menor VRAM (4 GB o más). Chatterbox es razonable (4–8 GB). OpenVoice es la más exigente (8 GB como mínimo). Para despliegue en el borde o GPU antiguas, XTTS v2 es la apuesta más segura.
Ética de la clonación de voz: lo que hay que saber
Clonar voces plantea preocupaciones reales. Es potente y, seamos claros, fácil de usar mal. Así se ve el uso responsable:
Casos de uso válidos:
- Clonar tu propia voz para un proyecto personal, una demostración o un producto
- Clonar con consentimiento por escrito de la persona dueña de la voz, entendiendo esta exactamente para qué se usará el clon
- Clonar voces sintéticas o ficticias (personajes, avatares) que no representan a personas reales
- Proyectos de investigación o accesibilidad con supervisión institucional y aprobación ética
Red flags:
- Clonar la voz de una figura pública sin consentimiento para audio falsificado
- Usar una voz clonada para hacerse pasar por alguien en llamadas fraudulentas, phishing o estafas
- Clonar una voz a partir de clips cortos (entrevistas, pódcast, redes sociales) sin pedir permiso
- Manipular o alterar el contenido clonado para tergiversar lo que dijo la persona original
El consentimiento tiene que ser informado: la persona debe saber qué datos de voz entrega, cómo se usarán y durante cuánto tiempo. Una casilla en un formulario no basta. Ofrece una forma sencilla de revocar el consentimiento y borrar los modelos clonados. Si construyes un producto, incluye condiciones que prohíban la suplantación y el fraude.
Técnicamente quizá puedas clonar una voz sin que nadie lo detecte. Éticamente sigue estando mal. Las herramientas se han democratizado; la responsabilidad es tuya.
Recomendaciones de hardware e instalación
Para un portátil o una GPU modesta (4–8 GB de VRAM)
Empieza con XTTS v2 o Chatterbox. Las dos funcionan con holgura. XTTS v2 si necesitas varios idiomas; Chatterbox si quieres velocidad y el inglés te basta.
Para una estación de trabajo media (8–16 GB de VRAM)
Las tres son viables. OpenVoice se vuelve práctica. Prueba cada una y elige según la calidad del resultado con tu tipo de voz. El procesamiento por lotes ya es factible — sintetiza decenas de enunciados seguidos sin recargar los modelos.
Para una instalación solo con CPU
XTTS v2 es tu mejor apuesta (modelo más pequeño). Chatterbox-Turbo también es posible, pero más lento. OpenVoice sufrirá. Cuenta con 3 a 5 segundos de generación por enunciado. Viable para desarrollo, pero no para producción.
Para uso en el borde o en tiempo real
Chatterbox-Turbo (latencia por debajo de 200 ms). Si necesitas varios idiomas, XTTS v2 como alternativa, con menos garantías de latencia.
Veredicto: qué herramienta para qué caso
Usa Chatterbox si: Estás construyendo un videojuego, una serie animada o ficción interactiva en inglés. La velocidad y la expresividad importan. Tienes una GPU modesta y quieres poca latencia. Disfrutas ajustando emoción y prosodia.
Usa OpenVoice si: Clonas a partir de clips de audio cortos. Necesitas salida entre idiomas desde un solo timbre. Estás construyendo un producto comercial y quieres una licencia clara. Tu audio de referencia es limitado (material de archivo, pocas muestras).
Usa XTTS v2 si: Necesitas 16 idiomas sin concesiones. Priorizas la estabilidad y la documentación madura. Estás empezando un producto mínimo viable o una prueba de concepto y quieres reducir la fricción de instalación. Tu hardware es modesto (4 GB de VRAM).
Preguntas frecuentes
¿Puedo mezclar estas herramientas en un mismo proyecto?
Sí. Algunos flujos usan XTTS v2 para la síntesis multilingüe y Chatterbox para volver a narrar con alta calidad las escenas clave. Carga un modelo cada vez para controlar la VRAM. No es elegante, pero funciona.
¿Cómo mejoro la calidad de mis clones de voz?
Prepara antes el audio de referencia: quita el ruido de fondo, normaliza el volumen y mantén el habla limpia y clara. Las muestras más largas (dentro de los límites de cada herramienta) ayudan. Prueba con distintas personas de tu conjunto de referencia. Si la voz está ronca, cansada o con un acento que no quieres conservar, usa otra referencia o limpia el audio. Ninguna de estas herramientas hace magia; reflejan lo que les das.
¿Y entrenar mi propio modelo?
Los tres proyectos permiten ajuste fino o entrenamiento de modelos propios, pero eso queda fuera del alcance de esta guía. XTTS v2 y Chatterbox tienen comunidades activas que comparten recetas de entrenamiento. Empieza por ahí si necesitas una voz especializada.
¿Funcionan estas herramientas en Mac?
Sí, con matices. La inferencia solo con CPU funciona en todas partes. La aceleración por GPU requiere NVIDIA CUDA o AMD ROCm en Linux, o Apple Metal en Mac (menos optimizado, más lento). OpenVoice y XTTS v2 tienen cierto soporte de Metal; el soporte de GPU de Chatterbox en Mac está menos maduro. Prueba en local antes de lanzarte a un lote grande.
¿Cómo gestiono la licencia y el despliegue?
Las tres son de código abierto. Revisa la licencia concreta (Chatterbox y XTTS v2 son de código abierto permisivo; OpenVoice es MIT). Puedes usarlas comercialmente, modificarlas y redistribuir versiones modificadas — dentro de los términos de la licencia. Si vendes un producto, lee la licencia entera y, si tienes dudas, consulta con alguien de perfil jurídico. No hay sorpresas aquí, pero la diligencia importa.
Reflexiones finales
La clonación de voz sin conexión ha pasado de curiosidad de investigación a herramienta de desarrollo. Estas tres opciones están listas para producción, se mantienen de forma activa y son gratuitas. La elección se reduce al alcance de idiomas, al presupuesto de VRAM y a qué concesiones de calidad estás dispuesto a aceptar.
Empieza por una: descárgala, clona tu propia voz y escucha el resultado. Las diferencias se notarán. Quédate con la que te suene bien y encaje con tus limitaciones.
Y recuerda: poder clonar técnicamente una voz no es permiso para usarla. Construye con responsabilidad.