Guía de cambiador de voz con IA para podcasts
Vuelve a locutar segmentos de tu podcast sin el sonido procesado de los cambiadores de voz con presets. Sigue un flujo basado en guion con Clonación de voz, Texto a voz y tu DAW para que tus episodios suenen naturales.
En resumen
Los cambiadores de voz con presets suelen sonar procesados en audios largos de podcast, y Flixly no tiene un cambiador de voz a voz. En su lugar, transcribe el segmento, genera una nueva locución con Clonación de voz (con el consentimiento del locutor) o con Texto a voz usando un modelo como Gemini 3.1 Flash TTS, prueba primero un fragmento corto y luego edita el resultado en su sitio dentro de tu DAW.
El error habitual al cambiar voces en un podcast
Muchos podcasters esperan que un cambiador de voz funcione como un filtro: subir el episodio, elegir un preset de otro locutor y descargar. Los efectos predefinidos conservan la grabación original por debajo y alteran su tono y timbre, por lo que el resultado suele sonar procesado en lugar de parecer otra persona.
Por qué los cambios simples rompen el ritmo del podcast
Los episodios de podcast son largos y están llenos de pausas, respiraciones, risas, voces superpuestas y énfasis. Un efecto predefinido tiene que arrastrar todo eso, y los oyentes notan enseguida los fragmentos metálicos o planos. Cuando un segmento necesita sonar realmente como otra voz, regenerar el habla a partir de un guion suele dar un resultado más limpio que filtrar la grabación.
Lo que sí funciona: volver a locutar desde una transcripción
Flixly no incluye un cambiador de voz de voz a voz, así que la vía práctica se basa en un guion: transcribe el segmento, limpia la transcripción y genera una nueva locución a partir de ella. Usa Clonación de voz cuando tengas permiso para usar la voz de una persona concreta: subes una muestra de voz limpia junto con el texto y obtienes la locución con esa voz. Usa Texto a voz cuando baste con una voz de stock, para intros, lecturas de anuncios o un narrador.
Como el nuevo audio se genera en lugar de convertirse, su sincronización no coincidirá automáticamente con la grabación original. Prevé editarlo para encajarlo en su sitio.
Cómo comprobar que el resultado es utilizable
Escucha la toma completa, no solo la primera frase. Comprueba que los nombres, las cifras y la jerga se pronuncian correctamente, que la respiración y el ritmo de las frases suenan naturales y que el tono encaja con el resto del programa. Colócala junto al segmento original en cualquier editor de audio y compáralas de oído.
Opciones de modelos disponibles en 2026
Modelos de audio de Flixly para trabajos de voz hablada:
- Gemini 3.1 Flash TTS para texto a voz
- OpenAI TTS y OpenAI TTS HD para texto a voz
- ElevenLabs Turbo V2.5 para texto a voz
- ElevenLabs Multilingual V2 para texto a voz y clonación de voz
- F5-TTS para texto a voz y clonación de voz a partir de una muestra de referencia
Comparativa de modelos
| Modelo | Texto a voz | Clonación de voz | Audio de referencia necesario | Precio |
|---|---|---|---|---|
| Gemini 3.1 Flash TTS | Sí | No | No | cotizado en la app |
| OpenAI TTS / TTS HD | Sí | No | No | cotizado en la app |
| ElevenLabs Turbo V2.5 | Sí | No | No | cotizado en la app |
| ElevenLabs Multilingual V2 | Sí | Sí | Para clonar | cotizado en la app |
| F5-TTS | Sí | Sí | Sí | cotizado en la app |
Flujo paso a paso para cambiar la voz de un podcast
- Exporta desde tu DAW el segmento que quieres volver a locutar como un archivo independiente y deja intacto el episodio original.
- Transcríbelo con tu herramienta de transcripción habitual y corrige nombres, cifras y palabras mal entendidas.
- Obtén el consentimiento de la persona cuya voz vas a clonar y luego prepara una muestra limpia: un solo locutor, sin música y sin ruido de fondo.
- Abre Clonación de voz, sube la muestra, pega la transcripción corregida y revisa la cotización de créditos.
- Genera primero un párrafo corto de prueba y escucha la pronunciación y el tono.
- Si la prueba no suena bien, prueba con una muestra más limpia o divide el guion en fragmentos más cortos y vuelve a generar.
- Genera el segmento completo, fragmento a fragmento si es largo, y descarga el audio para la mezcla.
Cómo integrar la nueva pista en el episodio
Importa el audio generado encima del segmento original. Alinea la primera palabra hablada y luego corta y desplaza las frases para que las pausas caigan donde estaban. Iguala el volumen con el resto del programa y aplica la misma ecualización, compresión y tono de sala que usas en otras partes para que la nueva voz se integre en la mezcla. Si el segmento original tiene una base musical, Separación vocal puede ayudarte a separar la voz de la música para conservar la base bajo la nueva toma.
Cuándo volver a locutar solo una parte del episodio
A menudo solo un segmento de un invitado o una corrección necesita una voz nueva. Exporta únicamente esa parte, vuelve a locutarla con Clonación de voz o Texto a voz y colócala de nuevo en su sitio. Los segmentos del presentador quedan intactos; avisa a los oyentes cuando un segmento use una voz sintética.
Preguntas frecuentes
¿Qué muestra produce el clon más estable para episodios largos?▾
Usa una grabación limpia de un solo locutor, sin música ni ruido de fondo, con el estilo de locución que buscas. La calidad de la muestra importa más que su duración; si un clon suena inestable, prueba con una grabación más limpia y uniforme.
¿El sistema permite exportar stems para mantener la música y la voz separadas?▾
Las herramientas de voz de Flixly devuelven únicamente el audio de voz generado, sin música, así que llega como una pista de voz independiente para tu mezcla. Para separar una voz de una base musical en un audio existente, prueba Separación vocal en Music Tools.
¿Cuántos créditos consume un episodio típico de 45 minutos?▾
Depende del modelo y de cuánto texto generes. La app muestra una cotización de créditos antes de cada generación, y los créditos provienen de paquetes de créditos de pago único.
¿Puedo cambiar solo a un locutor y dejar intacto al copresentador?▾
Flixly no detecta ni separa locutores automáticamente. Exporta solo los segmentos de ese locutor, vuelve a locutarlos a partir de la transcripción y colócalos de nuevo en su sitio; el audio del copresentador queda exactamente como se grabó.


