Cómo clonar tu voz gratis con IA en 2026: tutorial completo (GPT-SoVITS, OpenVoice, Fish Speech)

Cómo clonar tu voz gratis con IA en 2026: tutorial completo (GPT-SoVITS, OpenVoice, Fish Speech)

15 de agosto del 202621 minIA, voz, TTS, clonación de voz, GPT-SoVITS, OpenVoice, Fish Speech, self-hosting

Disclaimer ético (leelo primero): este tutorial es para clonar tu propia voz o la voz de alguien que te dio consentimiento escrito y firmado. No clonar la voz de otra persona sin permiso es ilegal en la mayoría de jurisdicciones y éticamente inaceptable. La ELVIS Act de Tennessee (2024), la reforma del Código Penal en España de marzo 2025 (cadeproject.org) y el AI Act de la UE penalizan la suplantación y la distribución no consentida de voces generadas por IA. Una sección entera del post está dedicada a esto.

Respuesta corta (60 segundos): clonar tu voz gratis en 2026 es viable con tres herramientas open-source que corren en local: GPT-SoVITS (la mejor calidad con fine-tune, necesita GPU NVIDIA ≥6 GB VRAM), OpenVoice V2 (clonación instantánea con 10-30 s de muestra, MIT license) y Fish Speech 1.5/S2 (latencia ~100 ms, Apache 2.0, comercial-friendly). Todas gratis, todas en local. Con 5-30 minutos de audio limpio y un poco de paciencia, la calidad es comparable a ElevenLabs pro. No uses estas herramientas para clonar la voz de otro sin su consentimiento escrito y firmado: eso es ilegal y éticamente inaceptable.

Clonar voces con IA dejó de ser ciencia ficción en 2023-2024 y se convirtió en commodity open-source en 2025-2026. Ya no necesitás pagar ElevenLabs (USD 5-22/mes), PlayHT (USD 31-99/mes) ni LMNT (USD 8-30/mes) para tener tu propio voice clone: con tu laptop, un micrófono decente y una de las tres herramientas de este post, podés entrenar y correr tu modelo en local, sin enviar un solo byte a la nube.

Este post es el tutorial que me hubiera gustado leer cuando arranqué: lo que funciona, lo que no, cuánto audio necesitás, qué hardware, qué ética respetar y qué regulación te puede caer si cruzás la línea. Si solo querés probar rápido, saltá a OpenVoice V2. Si querés calidad máxima y tenés GPU, arrancá con GPT-SoVITS. Si querés poner un voice agent en producción hoy, Fish Speech es tu opción.

Disclosure: corrí las pruebas en un M3 Max 128 GB y un RTX 4090. Los números de VRAM, latencia y duración de inferencia son míos o provienen de issues / README oficiales en GitHub (RVC-Boss/GPT-SoVITS, myshell-ai/OpenVoice, fishaudio/fish-speech). Donde tiro un benchmark sin fuente exacta, lo aclaro en el texto.


Por qué clonar tu voz (casos válidos)

Antes de entrar al tutorial, vale la pena enumerar para qué sirve legítimamente clonar tu propia voz:

  • Audiolibros propios. Si sos autor y querés narrar tu libro sin pasar 40 horas en el micrófono, entrenás tu voz con 30 min de muestra y generás el audiolibro en una tarde.
  • Podcasting y video. Producción de contenido multilenguaje: clonás tu voz y la usás para narrar en idiomas que no hablás, manteniendo el timbre.
  • Branding personal / agente de IA. Para un SaaS, un agente de voz con tu timbre personal suena más profesional que una voz TTS genérica.
  • Accesibilidad. Personas que perdieron la voz por una enfermedad (ELA, laringectomía) pueden clonar su voz de un audio viejo y volver a «hablar» con su familia. Este es el caso de uso más humano de la tecnología.
  • Doblaje y localización. Para indie game devs, documentales y contenido educativo, clonar la voz de un actor con su permiso cuesta USD 5K-50K; clonarla vos mismo reduce el costo a horas de cómputo.

Lo que NO es caso válido lo cubrimos en la sección de ética. Saltá ahora si te da igual el tutorial, pero leelo antes de hacer nada.


Las 3 herramientas que importan en 2026

El ecosistema de voice cloning open-source es chico pero denso. Tres proyectos concentran el 90% del uso real:

1. GPT-SoVITS — calidad máxima con fine-tuning

Desarrollador: RVC-Boss community (mismo grupo detrás de Retrieval-based Voice Conversion).
License: MIT.
Cuándo usarlo: cuando necesitás calidad máxima y tenés 10+ minutos de audio limpio + una GPU NVIDIA ≥6 GB VRAM. Es el gold standard de la comunidad.

GPT-SoVITS combina un modelo GPT-style de lenguaje con SoVITS (la arquitectura SOTA de TTS few-shot) y entrega una calidad que, con fine-tuning, compite con ElevenLabs. La contra: el setup inicial no es trivial (Python 3.10, PyTorch con CUDA, dataset preprocesado), y el fine-tune tarda 2-6 horas en una RTX 4090.

2. OpenVoice V2 — clonación instantánea

Desarrollador: MyShell (con colaboración del MIT).
License: MIT, con uso comercial explícitamente permitido.
Cuándo usarlo: cuando querés clonar una voz sin entrenar, con 10-30 s de muestra. Casi instantáneo, multilingüe y cross-lingual (podés clonar una voz en español y hacer que hable en inglés manteniendo el timbre).

OpenVoice V2 (release abril 2024) es la herramienta que recomiendo para probar primero. La instalación son tres comandos y la calidad para few-shot es decente. Si el resultado te convence, ahí decidís si vale la pena pasar a GPT-SoVITS para más calidad.

3. Fish Speech 1.5 / S2 — producción comercial

Desarrollador: Fish Audio (equipo chino con base en HK).
License: Apache 2.0 (1.5) y modelo dual-license (S2 con plan comercial).
Cuándo usarlo: cuando necesitás latencia <100 ms para producción (agente de voz, kiosk, IVR). Entrenado en 10+ millones de horas de audio, 50 idiomas incluyendo español.

Fish Speech S2 (speech.fish.audio) entrega la mejor combinación de calidad + latencia + idioma entre las opciones open-source. La contra: el modelo S2 es grande (2-4 GB) y la versión comercial tiene costo cuando superás cierto volumen, pero el modelo 1.5 base es totalmente gratis.


Tabla comparativa

HerramientaInstalaciónVRAM mín.MuestraCalidadLatenciaLicenciaIdiomasMejor para
GPT-SoVITSMedia (Python + modelo)6 GB few-shot / 12 GB fine-tune5 s - 30 minExcelente con datasetMedia (~1-3 s/fragmento)MITES/EN/ZH/JP/KR y másAudiobook, doblaje, voz personalizada
OpenVoice V2Fácil (pip install)4 GB / CPU viable10-30 sBuena para few-shotBaja (~instantáneo)MIT + comercial OKES/EN/ZH/JP/KR + cross-lingualClonación rápida, prueba de concepto
Fish Speech 1.5/S2Muy fácil (Docker)4 GB / CPU viable10-30 sMuy buenaMuy baja (~100 ms TTFA)Apache 2.0 (1.5), dual (S2)~50 idiomasProducción, baja latencia, comercial

Lectura de la tabla:

  • OpenVoice es la opción rápida para experimentar y validar si el voice cloning te sirve para tu caso. Si funciona, ahí decidís.
  • Fish Speech es la elección para producción comercial: latencia ~100 ms, licencia permisiva, soporta 50 idiomas incluyendo español latino.
  • GPT-SoVITS da la mejor calidad final si tenés tiempo para entrenar / fine-tunear con 10+ minutos de audio limpio.

Tutorial paso a paso: GPT-SoVITS

Este es el tutorial completo para el caso "calidad máxima". Asume que tenés Linux o Windows, una GPU NVIDIA con ≥6 GB VRAM y paciencia para la instalación.

Requisitos previos

  • GPU NVIDIA con ≥6 GB VRAM (driver + CUDA 12.4 o superior). Probado en RTX 3060, 4060, 3090, 4090.
  • Python 3.10 (no 3.11 ni 3.12 todavía, la comunidad recomienda 3.10 para máxima compatibilidad).
  • FFmpeg instalado (para preprocesar audio).
  • Disco: ~15 GB libres para el repo + dependencias + modelos preentrenados.

Paso 1: clonar el repo e instalar dependencias

git clone https://github.com/RVC-Boss/GPT-SoVITS.git
cd GPT-SoVITS
pip install -r requirements.txt

Si estás en Windows y la instalación falla, el repo tiene instrucciones detalladas con Conda. En Mac Apple Silicon funciona vía MPS pero es lento para entrenamiento; usable solo para inferencia.

Paso 2: descargar modelos preentrenados

# Modelos base de GPT-SoVITS y UVR5 (separador de voz)
huggingface-cli download RVC-Boss/GPT-SoVITS pretrained_asr pretrained_vits pretrained_semantic bert --local-dir pretrained_models
huggingface-cli download lj1995/VoiceConversionWebUI uvr5_weights --local-dir uvr5_weights

Si huggingface-cli no está instalado: pip install -U "huggingface_hub[cli]". Son ~6 GB totales.

Paso 3: grabar y preparar tu dataset

La calidad del audio de muestra es la variable más importante. Mal audio = mal clon, sin importar cuántos epochs entrenes.

Reglas de grabación:

  1. Lugar silencioso. Sin aire acondicionado fuerte, sin tráfico, sin televisión de fondo. Un clóset con ropa colgada es sorprendentemente bueno como cámara anecoica casera.
  2. Micrófono decente. Un USB cardioide decente (Blue Yeti, Fifine K669, AT2020+) alcanza. No necesitás un Neumann de USD 1K. Evitá el micrófono de la laptop, recoge demasiado ruido ambiente y reverb.
  3. Formato: 16-bit 44.1 kHz mono WAV. Audacity o el grabador de tu preferencia.
  4. Contenido: lectura en voz alta, varied tones (no monotonía). 10-30 minutos es ideal para fine-tune completo; 30 segundos sirven para few-shot.
  5. Sin música de fondo, sin reverb, sin clipping (la barra roja del meter).

Una vez grabado, preprocesá con la herramienta interna:

# UVR5 separa la voz del ruido de fondo (opcional)
python uvr5/uvr5.py --input_path tu_audio.wav --output_path procesado/

# SubVoice: segmenta automáticamente en frases cortas
python GPT_SoVITS/s2_train_prepare_v3.py --input_audio procesado/ --output_dir dataset/

Paso 4: entrenar el modelo

Para few-shot (pocos segundos de muestra, resultado inmediato, calidad moderada):

# Few-shot: cargás el modelo preentrenado y le pasás tu muestra
python webui.py --api_only --api_port 9880
# Abrir http://localhost:9880/ en el navegador
# Pestaña "Few-Shot" → subir tu audio de 10-30 s + texto
# → clic "Inferir"

Para fine-tune completo (10+ min de muestra, 2-6 h de entrenamiento en RTX 4090, mejor calidad):

# 1. Preprocesar dataset
python GPT_SoVITS/s1_train_prepare.py --input_dir dataset/ --output_dir output/

# 2. Entrenar modelo GPT (text encoder)
python GPT_SoVITS/s2_train.py --config configs/s2.json --output_dir output/ --num_workers 4

# 3. Entrenar modelo SoVITS (audio decoder)
python GPT_SoVITS/s3_train.py --config configs/s1.json --output_dir output/ --num_workers 4

El primer entrenamiento tarda 2-6 horas; los siguientes con transferencia de learning bajan a 30-60 min.

Paso 5: inferencia con WebUI

python webui.py
# Abre http://localhost:7860 (Gradio WebUI)
# Pestaña "Inference" → elegí tu modelo entrenado → escribí texto → "Generar"

Resultado: un WAV de tu voz diciendo el texto que escribiste, en el timbre que clonaste. No enviaste nada a la nube — todo el procesamiento fue local.

Costos y tiempos

EtapaTiempo RTX 4090Tiempo RTX 3060Costo nube (RunPod)
Instalación30-60 min30-60 min
Preprocesar audio (30 min)5 min15 min
Fine-tune GPT (10 epochs)1.5 h4 hUSD 1-3
Fine-tune SoVITS (10 epochs)1 h3 hUSD 1-3
Inferencia (60 s de audio)<30 s1-2 min<USD 0.05

Si querés evitar comprar GPU, RunPod / Lambda Labs alquilan RTX 4090 a USD 0.50-0.70/hora. Para un solo fine-tune gastás USD 2-4 y tenés un modelo reusable offline.


Tutorial rápido: OpenVoice V2

Si querés probar en 5 minutos si el voice cloning te sirve, OpenVoice es tu opción.

Instalación

git clone https://github.com/myshell-ai/OpenVoice.git
cd OpenVoice
pip install -e .
# Descargar modelos (checkpoints V2)
python -c "from openvoice import download; download('v2')"

Clonación con sample de 10-30 s

from openvoice import ToneColorConverter
from melo.api import TTS

# 1. Generar audio base en algún idioma con un speaker preentrenado
text = "Hola, esto es una prueba de clonación de voz con OpenVoice."
tts = TTS(language="ES", device="cuda:0")  # "cpu" si no tenés GPU
src_path = tts.tts_to_file(text, speaker_id=0, output_path="base.wav")

# 2. Aplicar el timbre de tu muestra (10-30 s WAV limpio)
converter = ToneColorConverter("checkpoints/v2/converter/config.json")
converter.download("v2")

target_path = "mi_voz.wav"  # tu audio de muestra, 10-30 s, mono 44.1kHz
output_path = "resultado_clonado.wav"
converter.convert(
    audio_src_path=src_path,
    audio_se_path=target_path,
    tone_color_converter=converter,
    output_path=output_path,
)

Resultado: resultado_clonado.wav tiene el contenido hablado de base.wav (texto en español) en el timbre de mi_voz.wav. Sin entrenar nada. El proceso tarda 2-5 segundos.

Variantes útiles

  • Cross-lingual: cambiá language="ES" por "EN" / "JP" / "FR" y el speaker mantiene el timbre de tu muestra en otro idioma.
  • Más calidad: pasale un sample más largo (1-3 min) y vas a notar mejora en prosodia.
  • API REST: OpenVoice V2 expone un servidor FastAPI que podés usar desde cualquier lenguaje.

Tutorial rápido: Fish Speech

Si necesitás latencia baja (<100 ms time-to-first-audio) y licencia comercial amigable, Fish Speech es la opción directa.

Instalación con Docker (un comando)

docker run -d --name fish-speech \
  -p 8260:8260 \
  -v $(pwd)/checkpoints:/app/checkpoints \
  fishaudio/fish-speech:latest

El contenedor expone una API en http://localhost:8260 con endpoints para inferencia y voz de referencia.

Clonación con 10-30 s de muestra

# 1. Subí tu audio de referencia (10-30 s, mono, 44.1 kHz) a un directorio
cp mi_voz.wav checkpoints/ref_audio/

# 2. Inferencia vía API
curl -X POST http://localhost:8260/v1/tts \
  -H "Content-Type: application/json" \
  -d '{
    "text": "Hola, esto es Fish Speech clonando mi voz.",
    "reference_audio": "mi_voz.wav",
    "reference_text": "Texto exacto de lo que digo en mi audio de referencia.",
    "max_new_tokens": 2048
  }' \
  --output resultado.wav

Tiempo-a-primer-audio: ~100 ms en RTX 4090, ~300 ms en CPU moderno. La calidad para muestras de 10-30 s es comparable a OpenVoice con la ventaja de latencia más baja y soporte robusto de español.

Versión Fish Audio S2 (comercial)

Si querés calidad de producción sin entrenar y la latencia más baja posible, Fish Audio S2 (versión actualizada con modelo dual-license) entrega audio de alta calidad con zero-shot, soporta 50 idiomas y expone la API oficial en api.fish.audio. El plan free cubre 20K caracteres / mes; producción escala a USD 0.10-0.20 / 1M caracteres.


Calidad de la salida: cómo mejorarla

La calidad de la voz clonada depende, en orden, de:

1. Calidad del audio de muestra

Esta es la variable con más impacto. Una muestra mala no se arregla con más epochs ni más VRAM.

Audios que arruinan el clon:

  • Reverberación de cuarto vacío o baño (el modelo aprende el eco como parte de la voz).
  • Ruido de aire acondicionado, heladera, computadora (queda en el fondo de cada síntesis).
  • Música de fondo, even faint.
  • Múltiples hablantes (el modelo no sabe cuál clonar).
  • Clipping (la voz se «corta» en los picos; usualmente porque el micro estaba demasiado cerca o la ganancia demasiado alta).
  • Codecs con pérdida (MP3, AAC): comprimen y pierden armónicos altos. Usá WAV o FLAC.

Cómo grabar un buen audio en casa:

  1. Cerrate en un clóset con ropa colgada (atenuación natural ~10-15 dB).
  2. Usá un micrófono cardioide USB a ~15-20 cm de la boca.
  3. Grabá con Audacity o REAPER, 16-bit 44.1 kHz mono WAV.
  4. Hacé 5-10 minutos de lectura en voz alta con varied prosodia (leé párrafos, hacé preguntas, exclamá). Evitá monotonía.

2. Cantidad de muestra

Para few-shot (OpenVoice, Fish Speech): 10-30 segundos alcanza para calidad decente. Con 1-3 minutos notás mejora. Con más de 5 minutos la mejora marginal es chica.

Para fine-tune (GPT-SoVITS): 10+ minutos es el sweet spot. Hay ejemplos de fine-tunes exitosos con 30 minutos; con más de 1 hora la mejora es marginal salvo que el audio sea súper consistente.

3. Limpieza del audio

Antes de entrenar, pasá tu audio por:

  • UVR5 (incluido en GPT-SoVITS) para separar voz / ruido / reverberación.
  • Audacity Noise Reduction (efecto nativo, manual pero funciona) para limpiar hiss de fondo.
  • Auphonic (servicio web con free tier mensual de 2 horas) para normalizar loudness y aplicar EQ suave.

4. Prosodia y emoción

Los modelos few-shot heredan la prosodia de tu muestra. Si tu audio es monotónico, el clon va a sonar robótico. Grabá varied: leé noticias, leé una pregunta, hacé una exclamación, un susurro. Los modelos actuales copian esa variedad al sintetizar.

5. Evaluación

Evaluación objetiva:

  • WER (Word Error Rate): transcribí el audio generado con Whisper y compará con el texto original. WER <5% es buen resultado.
  • Speaker similarity cosine: usá modelos de speaker verification como Resemblyzer o pyannote.audio para medir qué tan similar es el clon a la voz original.

Evaluación subjetiva:

  • MOS (Mean Opinion Score): pedile a 5-10 personas que escuchen el clon y califiquen naturalidad 1-5. Un buen clon fine-tuneado llega a MOS 4.0-4.5; ElevenLabs pro llega a 4.5-4.7.

Troubleshooting: problemas comunes

SíntomaCausa probableFix
Voz robótica/metálicaCuantización mal aplicada o muestra insuficienteReentrenar con fp32, no int8. Few-shot con >30s de muestra.
Drift de acentoMuestra tiene acentos mezcladosReentrenar con audio limpio de un solo acento, o fine-tune.
Alucinaciones fonéticas (palabras inventadas)Modelo few-shot con muestra pobre o texto muy técnicoAumentar muestra (5-10 min) o usar fine-tune completo.
OOM (out of memory) en GPUModelo + contexto demasiado grandeReducir batch_size, usar --half, o cerrar otras apps que usen GPU.
Latencia alta en CPUModelo grande + CPU no-avx2Usar GPU o llama.cpp-style quantization para el modelo.
Audio de salida con ruidoMuestra de referencia tenía ruidoPreprocesar con UVR5 o Audacity antes de entrenar.
Modelo "clona" el ruido de fondoEl modelo aprendió el ruido como parte de la vozLimpiar audio antes (UVR5 + Audacity Noise Reduction).
Habla con velocidad inconsistenteMuestra tiene pausas y habla irregularReentrenar con audio normalizado en loudness (-16 LUFS) y velocidad.

Hardware: qué necesitás

GPUVRAMGPT-SoVITS few-shotGPT-SoVITS fine-tuneOpenVoice V2Fish Speech
RTX 3060 / 40608-12 GBOK (30-60 min)Justo (fp16 estricto)OKOK
RTX 3080 / 4070 Ti10-12 GBOKOK con fp16OKOK
RTX 3090 / 409024 GBExcelenteExcelenteOKOK
RTX 509032 GBExcelenteExcelenteOKOK
M3 Pro 18 GB18 GB unifiedLento (MPS)No recomendadoOK (CPU)OK (CPU)
M3 Max 64 GB64 GB unifiedViable con pacienciaLento pero funcionaOK (CPU/MPS)OK
M3 Max 128 GB128 GB unifiedViable con MPSFunciona, 6-10 hOKOK
Sin GPU (CPU only)n/aNo recomendadoNo recomendadoViable (~30 s/clon)Viable con 1.5

Conclusión práctica: para few-shot (OpenVoice / Fish Speech), cualquier laptop moderna alcanza. Para fine-tune con GPT-SoVITS, una RTX 3060 con 12 GB es el piso; RTX 4090 es la elección si entrenás seguido. En Apple Silicon, fine-tune es viable pero 5-10× más lento que en NVIDIA CUDA.

Si todavía no compraste hardware para IA local, la guía de RAM para LLM explica cuánto necesitás por modelo. Para voice cloning en particular, el cuello de botella es VRAM no RAM.


Ética y legal: qué NO hacer

Esto no es un addendum: es sección obligatoria. Clonar voces sin consentimiento es una de las áreas con más regulación nueva de los últimos 12 meses.

Lo que NO podés hacer (en ninguna jurisdicción seria)

  1. Clonar la voz de otra persona sin consentimiento escrito y firmado. Aunque sea pública (YouTuber, podcaster, actor). El argumento «está en internet» no es defensa legal.
  2. Suplantar identidad (fraude bancario, pasar verificación de voz de un call center, scams telefónicos). Esto es fraude puro, con o sin IA.
  3. Crear propaganda electoral engañosa con la voz de un candidato. En EE.UU., la FTC ya emitió guía específica sobre esto.
  4. Entrenar con datasets de audios de terceros sin permiso (audiolibros, podcasts, música, calls de call centers). Es lo que llaman «model collapse ético» y múltiples juicios en 2024-2025 (Reuters, July 2025 sobre Lovo / Lehrman, ELVIS Act lawsuits).
  5. Distribuir modelos entrenados con la voz de otra persona. Es la peor categoría de la regulación 2025.
  6. Usar voice cloning para acosar, intimidar o generar abuso sexual (deepfake pornográfico de voz). En muchas jurisdicciones esto es delito penal con penas de cárcel.

Regulación vigente 2025-2026 que te conviene conocer

JurisdicciónRegulaciónImplicancia
EE.UU. — TennesseeELVIS Act (2024)Penaliza distribución no consentida de voice clones. Primer estado con ley específica.
EE.UU. — FederalNO FAKES Act (propuesto) + FTC guidanceDisclosure obligatorio de deepfakes en anuncios comerciales.
EspañaReforma Código Penal marzo 2025 (cadeproject, El País)Voz IA se incorpora como intromisión al honor. Delito de suplantación con IA.
Unión EuropeaAI Act (2024, entrada gradual 2025-2026)Categoría de «riesgo limitado» para deepfakes: disclosure obligatorio de que es IA.
MéxicoLey Federal de Protección de Datos Personales +lineamientos sobre IA en desarrolloConsentimiento explícito para tratamiento de datos biométricos (la voz es dato biométrico).
BrasilLGPD (2020) + regulación IA en desarrolloDatos biométricos requieren consentimiento.
JapónLineamientos sobre IA generativa (METI, 2024)No hay ley específica aún, pero precedentes judiciales de 2024-2025.

El consentimiento escrito, versión seria

Si vas a clonar la voz de alguien que no sos vos, el consentimiento debería ser:

«Yo, [nombre completo], DNI [número], autorizo expresamente a [tu nombre] a clonar mi voz usando técnicas de inteligencia artificial para los siguientes usos: [lista específica: audiobook, podcast, agente de voz, etc.]. Esta autorización es por [duración]. Puedo revocarla con 30 días de aviso.»

Firmado, con fecha, con dos testigos si es posible. No es paranoia: es lo que cubre tu responsabilidad legal si la persona revoca el permiso o si un tercero te reclama.


Checklist operativa

Antes de clonar tu voz (o una voz con permiso), pasá por esta lista:

  • Confirmá que tenés derecho a clonar la voz. Si no es la tuya, tenés consentimiento escrito firmado.
  • Grabaste audio limpio, 16-bit 44.1 kHz mono WAV, sin ruido ni reverb, varied prosodia, 10-30 min si vas a fine-tunear.
  • Preprocesaste el audio (UVR5 o Audacity para separar voz del ruido).
  • Elegiste la herramienta correcta según tu caso: OpenVoice para probar, Fish Speech para producción, GPT-SoVITS para calidad máxima.
  • Tenés el hardware necesario (GPU NVIDIA ≥6 GB para GPT-SoVITS; CPU/GPU liviana para OpenVoice/Fish Speech).
  • Verificás la calidad post-entrenamiento con WER (Whisper) y un MOS rápido con 3-5 personas.
  • No vas a usar el clon para suplantar, defraudar, acosar o engañar.
  • Si lo desplegás como servicio, agregás disclosure de que es voz IA (cumplimiento AI Act UE).

Conclusión

Clonar tu voz gratis en 2026 es totalmente viable, las tres herramientas open-source líderes (GPT-SoVITS, OpenVoice V2, Fish Speech) están maduras y corren en local. La decisión entre las tres depende de tu caso:

  • Probar si el voice cloning te sirve, validar con un cliente, hacer un demo: OpenVoice V2, 5 minutos de setup.
  • Audiolibro, doblaje, branding personal con calidad máxima: GPT-SoVITS, 2-6 h de fine-tune en una RTX 4090 o alquilando GPU en RunPod.
  • Producción comercial con latencia <100 ms: Fish Speech 1.5 (Apache 2.0) o Fish Audio S2 (plan comercial).

La calidad de salida depende 80% del audio de muestra y 20% del modelo. Si grabás audio limpio y varied, los tres te dan resultados comparables a servicios pagos. Si el audio es malo, ningún modelo lo arregla.

Y sobre la ética: no es un addendum al final del post, es parte del flujo de trabajo. Consentimiento escrito para voces ajenas, disclosure obligatorio de IA cuando deploys, cero tolerancia para suplantación o fraude.

Si tu startup está explorando self-hosting de TTS o voice agents y querés validar el setup con tus workloads reales antes de comprometerte a hardware o a un vendor pago, reservá una llamada gratis de 30 minutos — solemos poder calcularte el costo total y la arquitectura correcta en una sesión.


Leer también:

Preguntas frecuentes

¿Cómo clonar mi voz gratis con IA?

Tres herramientas open-source permiten clonar tu voz gratis en 2026: GPT-SoVITS (mejor calidad con dataset de 10+ min, requiere GPU), OpenVoice V2 (instantáneo con 10-30 s de muestra, MIT license) y Fish Speech 1.5/S2 (latencia ~100 ms, Apache 2.0, multilingüe). Todas corren en local sin enviar datos a la nube. Tutorial paso a paso con comandos en cada herramienta.

¿Qué herramientas gratuitas existen para clonar voces en 2026?

Las tres más maduras son GPT-SoVITS (RVC-Boss, MIT license), OpenVoice V2 (MyShell + MIT, abril 2024) y Fish Speech 1.5/S2 (Fish Audio, Apache 2.0). Cada una resuelve un caso distinto: GPT-SoVITS para calidad máxima con fine-tuning, OpenVoice para clonación few-shot sin entrenar, Fish Speech para producción comercial con latencia &lt;100 ms.

¿Cuánto audio necesito para clonar una voz?

Depende de la herramienta. OpenVoice V2 y Fish Speech funcionan con 10-30 segundos de audio limpio para clonación few-shot. GPT-SoVITS mejora mucho con 5-30 minutos para fine-tuning completo. El audio debe ser limpio: 16-bit 44.1 kHz mono, sin ruido de fondo, sin reverberación, sin música. Grabado en un lugar silencioso con micrófono decente.

¿Es legal clonar la voz de otra persona con IA?

No sin consentimiento escrito. La ELVIS Act de Tennessee (EE.UU., 2024) penaliza la distribución no consentida de voice clones. La reforma de España de marzo 2025 incorpora la voz generada por IA como intromisión al honor en el Código Penal. El AI Act UE exige disclosure obligatorio de deepfakes. En la mayoría de jurisdicciones, clonar la voz de un tercero sin permiso expreso y firmado es ilegal y punible.

¿Necesito una GPU dedicada para clonar voces con IA?

No para probar: OpenVoice y Fish Speech corren en CPU (lento pero usable para few-shot). Sí para entrenar: GPT-SoVITS few-shot necesita ~6 GB de VRAM; fine-tune completo ~12 GB. Una RTX 3060 de 12 GB es el mínimo razonable. En Apple Silicon, OpenVoice y Fish Speech corren vía CPU/MPS, GPT-SoVITS requiere más RAM y paciencia.

¿Qué calidad tiene una voz clonada con IA gratuita vs ElevenLabs/PlayHT?

Con una muestra decente (5-30 min de audio limpio) y GPT-SoVITS fine-tune, la calidad es comparable a ElevenLabs pro. Fish Speech S2 con licencia comercial y su modelo de 50 idiomas es la mejor alternativa open-source en términos de calidad + latencia para producción. La diferencia es que las herramientas gratuitas requieren self-hosting y audio de muestra propio, mientras que ElevenLabs te da todo como servicio con voces pre-entrenadas.