Caso de uso
Texto a voz para agentes de IA
Un agente conversacional ya resuelve la parte difícil: entender la intención y redactar una respuesta correcta. El problema que queda es que esa respuesta llega como texto, y en canales de voz nadie va a leerla. Ahí entra MatuVoice.
El problema real
Cuando un agente pasa de chat a voz, el cuello de botella deja de ser la calidad del modelo y pasa a ser el tiempo hasta el primer sonido. Una persona tolera mal el silencio en una conversación hablada: si pasan más de un par de segundos sin audio, asume que la llamada se cortó.
Sintetizar por frases, no por respuesta completa
La técnica que más cambia la experiencia es no esperar a que el modelo termine. En cuanto el streaming del LLM cierra la primera oración, se envía esa oración a sintetizar y se empieza a reproducir. Mientras suena, el resto de la respuesta se sigue generando y sintetizando en cola.
// Por cada frase cerrada del stream del modelo
for await (const sentence of sentences(llmStream)) {
const audio = await fetch("https://matuvoice.matubyte.com/v1/speech", {
method: "POST",
headers: {
Authorization: `Bearer ${process.env.MATUVOICE_API_KEY}`,
"Content-Type": "application/json",
},
body: JSON.stringify({ text: sentence, voice: voiceId }),
});
queue.push(Buffer.from(await audio.arrayBuffer()));
}Elegir el personaje
Un agente mantiene la misma voz durante toda la conversación, así que la elección pesa más que en un video suelto. Dos criterios ayudan: que el acento coincida con el del usuario y que el registro corresponda al rol. Un agente de cobranza y uno de bienvenida no suenan igual aunque digan lo mismo.
El catálogo permite fijar un identificador estable por agente, por ejemplo edge:es-CR-JuanNeural, y cambiarlo solo cuando cambia el producto. Las variantes disponibles están en voces en español.
Dónde poner la clave
La API key va en el backend del agente, nunca en el cliente. El navegador o la app hablan con tu servidor, y tu servidor habla con MatuVoice. Así puedes revocar una clave concreta si un despliegue se compromete, sin tocar el resto de entornos.
Referencia completa de la APIPreguntas frecuentes
¿MatuVoice sirve para agentes de IA?
- Sí. El agente genera la respuesta con un modelo de lenguaje y MatuVoice convierte ese texto en audio. La plataforma no interviene en la conversación ni en la lógica del agente: solo se encarga de la locución.
¿Cómo reduzco la latencia percibida en un agente de voz?
- Sintetizando por frases en lugar de esperar a la respuesta completa. En cuanto el modelo cierra la primera oración, se envía a sintetizar y se empieza a reproducir mientras el resto se sigue generando.