Proveedores
VOCALS utiliza un sistema modular de proveedores para cada etapa del pipeline de voz: Speech-to-Text (STT), Large Language Model (LLM) y Text-to-Speech (TTS). Puedes combinar proveedores por agente para optimizar latencia, precisión, coste o soporte de idiomas.
Añadir un Proveedor
- Navega a Configuración > Proveedores en el panel de control.
- Haz clic en Añadir Proveedor.
- Selecciona el tipo de proveedor (STT, LLM o TTS) y el servicio específico.
- Introduce tu API key y configura los ajustes específicos del proveedor.
- Haz clic en Guardar.
Cada proveedor se valida al guardar -- VOCALS realiza una solicitud de prueba ligera para confirmar que tu API key y configuración son válidos.
Cuando la Validación Falla
Si la solicitud de prueba falla, el guardado se rechaza y el mensaje indica tanto el tipo de fallo como la explicación del propio proveedor, para que puedas actuar sin adivinar. Una key con el alcance equivocado, una voz que tu proyecto no puede usar o un modelo que tu plan no incluye se leen de forma distinta.
Algunos fallos no dependen de ti. Si la API del proveedor no está disponible momentáneamente, VOCALS reintenta la prueba automáticamente tras una breve pausa antes de darse por vencido, de modo que una caída pasajera del proveedor no rechace una configuración perfectamente válida. Cuando los reintentos no lo resuelven, el mensaje indica que el proveedor no está disponible temporalmente y te invita a intentarlo de nuevo: tu key y tu modelo no son el problema y no hay nada que cambiar.
Lo mismo se aplica a la síntesis de prueba que se ejecuta al guardar un agente y al botón Test de un proveedor ya guardado.
Elegir un Modelo
Cada proveedor tiene un desplegable Model con un conjunto corto y seleccionado de modelos recomendados para voz en tiempo real. Los catálogos de los proveedores incluyen decenas de modelos creados para otros fines -- generación de imágenes, música, investigación, transcripción de documentos, entradas internas de prueba -- y varios de ellos no pueden atender una llamada telefónica en absoluto, así que VOCALS solo lista los que sí pueden.
Cuando un proveedor publica una lista de modelos, el desplegable se reduce además a los modelos que tu propia API key puede usar realmente, de modo que nunca se te ofrece algo que tu plan no incluye.
Tres cosas que conviene saber:
- Tu selección actual nunca se descarta. Si un proveedor ya está configurado con un modelo fuera del conjunto recomendado, ese modelo sigue en el desplegable y continúa funcionando igual que antes. Para ti no cambia nada.
- El modelo recomendado por defecto siempre se ofrece. El modelo que aparece primero en cada proveedor es el que VOCALS usa cuando un proveedor no tiene ningún modelo seleccionado, así que sigue en el desplegable aunque el listado del propio proveedor no lo devuelva para tu key. Lo que puedes elegir y lo que se ejecuta por defecto nunca pueden discrepar.
- Puedes seguir usando cualquier modelo que acepte el proveedor. Si la lista no se puede cargar -- por ejemplo antes de introducir una API key -- el campo Model pasa a ser un cuadro de texto libre y puedes escribir cualquier id de modelo que el proveedor admita.
Los conjuntos recomendados siguen lo que publican los proveedores, así que las listas de abajo pueden crecer o cambiar entre versiones.
Gestión de API Keys
- Las API keys se cifran en reposo y nunca se muestran completas después de la entrada inicial.
- Para rotar una key, haz clic en el botón Editar de cualquier proveedor e introduce la nueva key.
- Si un proveedor devuelve errores de autenticación durante una llamada, la llamada realizará un fallback de forma elegante y el error aparecerá en los registros de llamadas.
Crea API keys separadas para VOCALS en lugar de reutilizar keys de otros proyectos. Esto facilita el seguimiento del uso y la rotación de credenciales sin afectar otras integraciones.
Eliminar un Proveedor
Un proveedor solo se puede eliminar cuando ningún agente lo usa. Si algún agente todavía lo tiene seleccionado como proveedor de STT, LLM, TTS o tiempo real, la eliminación se rechaza y el diálogo de confirmación enumera los agentes que la bloquean.
Para continuar, abre cada agente de la lista, apúntalo a otro proveedor (o elimina el agente) y vuelve a eliminar el proveedor.
Es intencionado. Eliminar un proveedor del que depende un agente dejaría a ese agente aparentemente configurado en la lista pero incapaz de atender una llamada, y nada te avisaría de ello.
Proveedores STT
Los proveedores Speech-to-Text transcriben el audio del llamante a texto en tiempo real.
Deepgram
| Ajuste | Descripción | Predeterminado |
|---|---|---|
| Model | nova-2, nova-3, nova-2-phonecall, nova-2-conversationalai | nova-2 |
| Language | Se elige de una lista con los idiomas que admite el modelo seleccionado | en-US |
| API Host | Endpoint de Deepgram al que llama este proveedor | Predeterminado del despliegue |
| Smart Format | Habilita puntuación, mayúsculas y formato numérico | Habilitado |
| Endpointing | Duración del silencio (ms) antes de finalizar una frase | 300 |
| Interim Results | Transmite transcripciones parciales para una respuesta más rápida | Habilitado |
Deepgram es el proveedor STT recomendado para la mayoría de casos de uso debido a su baja latencia y fuerte soporte de streaming.
Tanto nova-3 como nova-2 son multilingües: español, francés, alemán, portugués, hindi y el resto de la lista de idiomas de Deepgram se pueden seleccionar en ambos.
En nova-3, la lista de idiomas ofrece Multilingual (code-switching). Elígelo cuando un llamante alterna entre idiomas en la misma frase o llamada: Deepgram transcribe cada idioma según lo escucha en lugar de forzarlo todo a uno solo.
Las variantes de dominio de Deepgram (nova-2-phonecall, nova-2-conversationalai, nova-2-medical, nova-3-medical y los demás modelos de dominio nova-2-) solo transcriben inglés. Al seleccionar una de ellas, el dashboard restringe la lista de idiomas a variantes de inglés y borra un idioma ya elegido si el nuevo modelo no puede transcribirlo. Para un agente en otro idioma, elige el modelo base nova-3 o nova-2. Si un idioma que no es inglés llega de todos modos a un modelo solo en inglés - por ejemplo, escrito a mano en la configuración adicional - Deepgram devuelve transcripciones vacías en lugar de un error, así que el llamante se escucha como silencio.
API Host
Deepgram sirve los mismos modelos y la misma clave de API desde varios endpoints, y el viaje de ida y vuelta al más cercano suele ser el más rápido. El desplegable API Host elige a qué endpoint llama este proveedor:
| Opción | Llama a |
|---|---|
| Predeterminado del despliegue | El endpoint configurado en tu despliegue de VOCALS. Déjalo aquí salvo que tengas un motivo para cambiarlo. |
| Global | api.deepgram.com |
| UE | api.eu.deepgram.com |
| Australia | api.au.deepgram.com |
| Personalizado | Un endpoint dedicado emitido para tu cuenta de Deepgram, escrito en el campo que aparece |
El ajuste pertenece al proveedor, no al agente, así que puedes apuntar un agente a otra región creando un segundo proveedor de Deepgram: útil para comparar la latencia en llamadas reales antes de mover todo. El mismo desplegable aparece en un proveedor TTS de Deepgram y funciona igual. Los tres endpoints regionales aceptan la misma clave de API y no requieren configuración adicional en Deepgram.
Elegir un host es opcional y Predeterminado del despliegue es la respuesta correcta para casi todas las cuentas. Cámbialo solo si estás probando la latencia desde otra región o si Deepgram te ha emitido un endpoint dedicado.
ElevenLabs
| Ajuste | Descripción | Predeterminado |
|---|---|---|
| Model | scribe_v2, scribe_v1 | scribe_v2 |
| Language | Código ISO-639-1 (ej., en, es, fr) | en |
ElevenLabs Scribe opera en modo batch -- el audio se almacena en búfer y se transcribe cuando el llamante deja de hablar, en lugar de transmitirse continuamente.
scribe_v2 es la generación actual de ElevenLabs y cubre más de 90 idiomas. scribe_v1 está obsoleto según ElevenLabs y permanece en el desplegable solo para que los proveedores ya configurados con él sigan funcionando; cámbialos a scribe_v2 cuando te venga bien.
OpenAI Whisper
| Ajuste | Descripción | Predeterminado |
|---|---|---|
| Model | whisper-1, gpt-4o-mini-transcribe, gpt-4o-transcribe | whisper-1 |
| Language | Código ISO-639-1 (ej., en, es, fr) | Auto-detección |
| Temperature | Temperatura de muestreo para decodificación (0.0 - 1.0) | 0.0 |
OpenAI Whisper opera en modo batch -- el audio se almacena en búfer y se envía en fragmentos en lugar de transmitirse continuamente. Esto añade algo de latencia pero puede mejorar la precisión en entornos ruidosos.
Alibaba Qwen
| Ajuste | Descripción | Predeterminado |
|---|---|---|
| Model | qwen3-asr-flash-realtime | qwen3-asr-flash-realtime |
| Language | Código de idioma (ej., en, zh, ja) | en |
Qwen ofrece un sólido soporte multilingüe, particularmente para chino e idiomas del este asiático. Solo se ofrece el modelo de transcripción en tiempo real de Qwen: VOCALS transmite el audio por la conexión en tiempo real de Qwen, que los modelos de transcripción por lotes no atienden.
Fish Audio
| Ajuste | Descripción | Predeterminado |
|---|---|---|
| Model | transcribe-1 | transcribe-1 |
| Language | Código de idioma (opcional, auto-detección si está vacío) | Auto-detección |
El modelo transcribe-1 de Fish Audio opera en modo batch con soporte para más de 30 idiomas. Actualmente en beta.
Proveedores LLM
Los proveedores LLM generan las respuestas conversacionales del agente basándose en la transcripción y el prompt del sistema.
OpenAI
| Ajuste | Descripción | Predeterminado |
|---|---|---|
| Model | gpt-4o-mini, gpt-4o, gpt-4.1-mini, gpt-4.1-nano, gpt-4.1, gpt-5-mini, gpt-5-nano, gpt-5, o4-mini, o3-mini, o3 | gpt-4o-mini |
| Temperature | Controla la aleatoriedad (0.0 - 2.0) | 0.7 |
| Max Tokens | Tokens máximos en la respuesta | 256 |
Los modelos de OpenAI ofrecen un buen equilibrio entre calidad y velocidad. Usa gpt-4o-mini para conversaciones generales con buena relación coste-eficiencia y gpt-4o cuando la calidad de respuesta es crítica. Los modelos de razonamiento de la serie o van al final: se pueden seleccionar, pero razonan antes de responder, lo que añade un retraso perceptible en una llamada en directo.
Anthropic Claude
| Ajuste | Descripción | Predeterminado |
|---|---|---|
| Model | claude-haiku-4-5, claude-sonnet-5, claude-opus-4-8 | claude-haiku-4-5 |
| Temperature | Controla la aleatoriedad (0.0 - 1.0) | 0.7 |
| Max Tokens | Tokens máximos en la respuesta | 256 |
Claude sobresale en seguir prompts de sistema detallados y mantener personas consistentes. Una opción sólida para agentes que necesitan adherirse estrictamente a guiones o requisitos de cumplimiento normativo.
Google Gemini
| Ajuste | Descripción | Predeterminado |
|---|---|---|
| Model | gemini-flash-latest, gemini-flash-lite-latest, gemini-pro-latest, gemini-3-flash-preview | gemini-flash-latest |
| Temperature | Controla la aleatoriedad (0.0 - 2.0) | 0.7 |
| Max Tokens | Tokens máximos en la respuesta | 256 |
Gemini Flash ofrece una latencia muy baja a un precio competitivo. Una buena opción para despliegues de alto volumen donde la velocidad importa. gemini-flash-lite-latest es el nivel de Gemini más rápido y económico de los disponibles, a costa de algo de calidad en las respuestas: merece la pena probarlo en llamadas cortas y guionizadas, donde el agente se ciñe casi siempre a su prompt.
gemini-flash-latest, gemini-flash-lite-latest y gemini-pro-latest siguen la generación actual de Google, así que continúan funcionando a medida que Google retira ids de modelos antiguos. Prefiérelos salvo que tengas un motivo para fijar una versión concreta. Google deja de servir un modelo antiguo a las claves de API creadas después de una fecha de corte aunque siga apareciendo en el listado, de modo que un id fijado puede parecer disponible y fallar en la primera llamada: pulsa Test en el proveedor después de guardarlo y cambia a un alias -latest si la prueba indica que el modelo no está disponible para tu clave. Un modelo que hayas seleccionado antes permanece en el desplegable aunque desaparezca de la lista anterior.
Los modelos Gemini pueden "pensar" antes de responder, lo que añade segundos antes de que el agente hable; en una llamada quien llama lo percibe como silencio. Por eso los proveedores de Google Gemini nuevos que añadas se crean con el pensamiento extendido reducido al mínimo. Los proveedores que añadiste antes se mantienen exactamente como estaban.
El interruptor Desactivar pensamiento extendido del formulario del proveedor controla esto. Está activado por defecto al añadir un proveedor LLM de Google Gemini. Desactívalo para que el modelo use su comportamiento de razonamiento predeterminado, a costa de una primera respuesta más lenta. Abre un proveedor existente para cambiarlo en cualquier momento. En la generación actual de Google, que es a la que apuntan los alias -latest, el pensamiento no se puede desactivar por completo: el interruptor pide el mínimo que el modelo permite, que es la primera respuesta más rápida posible en esos modelos.
Moonshot Kimi
| Ajuste | Descripción | Predeterminado |
|---|---|---|
| Model | moonshot-v1-32k, moonshot-v1-8k, moonshot-v1-128k, kimi-latest, kimi-k2-turbo-preview | moonshot-v1-32k |
| Temperature | Controla la aleatoriedad (0.0 - 1.0) | 0.7 |
| Max Tokens | Tokens máximos en la respuesta | 256 |
Kimi ofrece un sólido soporte del idioma chino y precios competitivos para despliegues en el mercado asiático.
Proveedores TTS
Los proveedores Text-to-Speech convierten la respuesta de texto del LLM en audio que el llamante escucha.
Cambiar el proveedor TTS de un agente. Cada proveedor TTS tiene sus propios ajustes (modelo de voz, estabilidad, velocidad de habla, etc.). Cuando cambias el proveedor TTS de un agente, cualquier ajuste que no aplique al nuevo proveedor se borra, y el modelo y los ajustes propios del nuevo proveedor entran en vigor. Esto significa que un ajuste heredado de un proveedor anterior - por ejemplo un modelo de voz elegido para otro servicio - nunca puede arrastrarse e interferir con el nuevo. Revisa los ajustes del nuevo proveedor tras cambiarlo y guarda.
ElevenLabs
| Ajuste | Descripción | Predeterminado |
|---|---|---|
| Voice ID | El ID de la voz a utilizar (de tu cuenta de ElevenLabs) | -- |
| Model | eleven_flash_v2_5, eleven_turbo_v2_5, eleven_flash_v2, eleven_turbo_v2, eleven_multilingual_v2, eleven_v3 | eleven_flash_v2_5 |
| Stability | Consistencia de la voz (0.0 - 1.0). Valores más bajos suenan más expresivos. | 0.5 |
| Similarity Boost | Qué tan fielmente se reproduce la voz original (0.0 - 1.0) | 0.75 |
| Optimize Streaming Latency | Nivel de optimización de latencia (0 - 4, mayor = más rápido pero menor calidad) | 3 |
ElevenLabs produce las voces con sonido más natural y soporta clonación de voz.
El modelo que selecciones es el que usarán tus agentes. Nada sustituye otro por detrás. Los niveles eleven_flash_v2_5 y eleven_turbo_v2_5 responden más rápido y encajan en telefonía donde la latencia importa; eleven_v3 y eleven_multilingual_v2 suenan mejor, y la diferencia se nota especialmente en idiomas distintos del inglés. Cuál compensa es decisión tuya, así que tómala aquí y escucha una llamada de prueba.
Si creaste un agente el 23 de julio de 2026, puede que esté usando eleven_flash_v2_5 aunque este proveedor indique otra cosa, por un valor predeterminado que se aplicaba automáticamente durante un breve periodo y que ya se ha eliminado. Vuelve a crear el agente para limpiarlo.
En tu panel de ElevenLabs, ve a Voices, selecciona una voz y copia el Voice ID desde el panel de detalles de la voz. También puedes usar la API de ElevenLabs para listar las voces disponibles.
OpenAI TTS
| Ajuste | Descripción | Predeterminado |
|---|---|---|
| Model | tts-1, tts-1-hd, gpt-4o-mini-tts | tts-1 |
| Voice | alloy, echo, fable, onyx, nova, shimmer | alloy |
| Speed | Velocidad de reproducción (0.25 - 4.0) | 1.0 |
OpenAI TTS es sencillo de configurar con seis voces integradas. Usa tts-1 para telefonía (menor latencia) y tts-1-hd solo cuando la calidad de audio sea la máxima prioridad.
Resemble AI
| Ajuste | Descripción | Predeterminado |
|---|---|---|
| Voice UUID | El UUID de la voz de tu proyecto de Resemble | -- |
| Project UUID | El identificador de tu proyecto de Resemble | -- |
| Sample Rate | Frecuencia de muestreo de salida en Hz | 8000 |
Resemble AI se especializa en clonación de voz personalizada. Si necesitas una voz de marca que suene como una persona específica, Resemble es la mejor opción.
Fish Audio
| Ajuste | Descripción | Predeterminado |
|---|---|---|
| Model | s2, s1, speech-1.6, speech-1.5 | s2 |
| Reference ID | ID de referencia de voz de tu cuenta de Fish Audio | -- |
| Temperature | Controla la expresividad (0.0 - 1.0) | 0.7 |
| Top P | Parámetro de muestreo nucleus (0.0 - 1.0) | 0.7 |
| Speed | Multiplicador de velocidad de reproducción | 1.0 |
| Latency | low, balanced, normal | balanced |
Fish Audio produce habla de sonido natural con control de emociones en más de 30 idiomas. El modelo s2 es el más reciente y capaz, con latencia y calidad mejoradas respecto a s1. Usa latency: "balanced" para el mejor equilibrio entre velocidad y calidad en telefonía.
Google Cloud TTS
| Ajuste | Descripción | Predeterminado |
|---|---|---|
| Voice | La voz de Google a utilizar, elegida mediante un selector en cascada Idioma > Nivel > Voz. Los niveles clásicos listan el conjunto completo de voces en vivo de tu propio proyecto de Google Cloud para cada idioma, no una lista corta fija. | en-US-Neural2-C |
| Speaking Rate | Multiplicador de velocidad de reproducción (0.25 - 4.0). Se muestra solo para voces Neural2/WaveNet y Studio; se oculta para Chirp3-HD, que no lo soporta. | 1.0 |
Google Cloud TTS ofrece voces en varios niveles de calidad:
- Neural2 / WaveNet - el nivel establecido, con velocidad de habla ajustable.
- Chirp3-HD - el nivel de sonido natural de Google. Estas voces no soportan el ajuste de velocidad de habla, por lo que ese control se oculta cuando se selecciona una voz Chirp3-HD. Es una diferencia intencional del nivel, no una función ausente.
- Studio - voces premium solo en inglés. Studio ya no se ofrece al seleccionar una nueva voz, pero cualquier agente ya configurado con una voz Studio sigue funcionando exactamente como antes.
Las listas de voces se obtienen en vivo de tu propio proyecto de Google Cloud (usando la API key que guardaste), por lo que las voces ofrecidas siempre reflejan lo que ese proyecto puede usar realmente, en lugar de una lista genérica de la plataforma. El selector abarca los mismos siete idiomas - inglés (EE. UU.), inglés (Reino Unido), español, francés, alemán, portugués e italiano. Las voces se cargan la primera vez que abres el selector para un idioma y se reutilizan durante el resto de tu sesión, por lo que navegar sigue siendo ágil. Si la lista en vivo no se puede obtener, el selector recurre a un conjunto reducido conocido como válido y muestra un aviso.
Si cambias un agente de una voz Neural2/WaveNet a una voz Chirp3-HD después de ajustar una velocidad de habla, el ajuste se ignora de forma segura en lugar de causar un error - tu agente sigue funcionando sin ninguna reconfiguración.
Google Cloud TTS no ofrece voces Gemini. Google publica sus modelos de texto a voz Gemini en la Gemini API, un servicio distinto con su propia credencial y su propia facturación, que una clave de Google Cloud Text-to-Speech no puede alcanzar. Google Cloud TTS cubre los niveles Neural2/WaveNet, Chirp3-HD y Studio listados arriba.
Si quieres voces Gemini, añade Google Gemini TTS más abajo - un proveedor aparte con su propia API key de la Gemini API.
Si tu agente estaba configurado previamente con uno de los niveles Gemini de corta duración bajo Google Cloud TTS, sigue abriéndose y editándose con normalidad, pero el selector de voz no mostrará ninguna selección - elige uno de los niveles de arriba para poder guardarlo de nuevo, o mueve el agente a Google Gemini TTS.
Comprobación de voz al guardar. Siempre que guardas un agente que usa una voz de Google Cloud TTS, en cualquier nivel, VOCALS ejecuta una síntesis de prueba rápida de la voz exacta que seleccionaste antes de almacenar el agente. Si esa prueba falla - una clave inválida o insuficiente, una voz que tu proyecto no puede alcanzar, o cualquier otro error de síntesis - el guardado se rechaza con una explicación de lo que salió mal, de modo que una selección de voz rota nunca aparece por primera vez en una llamada en vivo. Una prueba exitosa guarda el agente sin pasos adicionales.
- Inicia sesión en la Consola de Google Cloud y selecciona (o crea) un proyecto.
- Habilita la Cloud Text-to-Speech API para ese proyecto: abre APIs y servicios > Biblioteca, busca "Cloud Text-to-Speech API" y haz clic en Habilitar. Si tu proyecto ya la tiene habilitada, omite este paso.
- Ve a APIs y servicios > Credenciales, haz clic en Crear credenciales > Clave de API y copia la clave generada.
- Pega la clave en el campo de API key del proveedor Google Cloud TTS en VOCALS y haz clic en Guardar. VOCALS valida la clave de inmediato, por lo que una clave inválida o un proyecto sin la Cloud Text-to-Speech API habilitada se detecta al guardar en lugar de en tu primera llamada en vivo.
Google te factura directamente por tu propio uso - VOCALS utiliza la clave que proporcionas.
Google Gemini TTS
| Ajuste | Descripción | Predeterminado |
|---|---|---|
| Model | gemini-2.5-flash-preview-tts, gemini-2.5-pro-preview-tts, gemini-3.1-flash-tts-preview. Se elige al añadir el proveedor. | gemini-2.5-flash-preview-tts |
| Voice | Una de 30 voces Gemini, elegida de una única lista plana en el agente. | Zephyr |
| Style Instruction | Una instrucción breve opcional que describe cómo debe pronunciar el texto la voz, p. ej. "Habla con calidez y despacio". Hasta 500 caracteres. | Vacío |
Google Gemini TTS es un proveedor aparte de Google Cloud TTS, listado por separado en la lista de Añadir Proveedor. Son servicios de Google distintos: credenciales distintas, facturación distinta y voces distintas. Añadir uno no te da el otro, y una clave de uno no funciona con el otro.
Los tres modelos difieren en aquello para lo que Google los ajusta:
gemini-2.5-flash-preview-tts- baja latencia y económico. El predeterminado, y la elección adecuada para la mayoría de las llamadas telefónicas.gemini-2.5-pro-preview-tts- el modelo de mayor calidad de Google, orientado a salida tipo pódcast y audiolibro.gemini-3.1-flash-tts-preview- ajustado para narración expresiva.
El modelo se elige por proveedor, no por agente. Si quieres unos agentes con flash y otros con pro, añade Google Gemini TTS dos veces - una con cada modelo - y apunta cada agente al que le corresponda. Es la misma forma en que hoy ejecutarías dos modelos de OpenAI.
A diferencia de Google Cloud TTS, Google Gemini TTS no tiene selector de idioma. El idioma hablado sigue automáticamente el propio texto de conversación de tu agente, así que una respuesta en español se pronuncia en español con la misma voz que elegiste. Por eso el selector de voz es una única lista plana y alfabética de 30 nombres en lugar de una cascada Idioma > Nivel > Voz - no hay idioma por el que acotarla. Cualquier voz Gemini puede hablar cualquiera de los idiomas soportados.
Instrucción de estilo. El campo de instrucción de estilo aparece solo cuando el proveedor TTS de tu agente es Google Gemini TTS. Escríbela como una instrucción sencilla - "Habla con calidez y despacio", "Suena animado y con energía", "Usa un tono calmado y profesional" - y se aplica a cada respuesta que pronuncie ese agente. Como los modelos Gemini reciben la dirección de interpretación como parte del texto, mantén la instrucción breve y redactada como una indicación; una vaga o mal formulada puede leerse en voz alta ocasionalmente en lugar de seguirse. El campo está limitado a 500 caracteres y un contador muestra cuántos te quedan. No tiene efecto en ningún otro proveedor TTS, incluido Google Cloud TTS.
Comprobación de voz al guardar. Igual que con Google Cloud TTS, guardar un agente que usa Google Gemini TTS ejecuta una síntesis de prueba rápida de la voz exacta que seleccionaste antes de almacenar el agente. Si falla, el guardado se rechaza con una explicación y no se cambia nada.
- Crea una clave en Google AI Studio - es la vía más rápida, y la clave funciona aquí de inmediato.
- O bien, en la Consola de Google Cloud: selecciona un proyecto, habilita la Generative Language API en APIs y servicios > Biblioteca, y luego crea una clave de API en APIs y servicios > Credenciales. Si restringes la clave en Restricciones de API, la Generative Language API debe estar entre las APIs permitidas.
- Pega la clave en el campo de API key del proveedor Google Gemini TTS en VOCALS y haz clic en Guardar. La clave se valida de inmediato con una síntesis de prueba real, por lo que una clave equivocada se detecta al guardar en lugar de en tu primera llamada en vivo.
Una clave de Google Cloud Text-to-Speech no funcionará aquí, aunque ambas sean API keys de Google. Si pegas una, el guardado se rechaza con un mensaje que te indica que la clave no está autorizada para la Gemini API - habilita la Generative Language API en ese proyecto y permítela en las restricciones de API de la clave, o crea una clave en Google AI Studio.
Google factura el uso de la Gemini API a tu propia cuenta, y se factura por separado de Google Cloud Text-to-Speech. Google te factura directamente - VOCALS utiliza la clave que proporcionas.
Recomendaciones de Proveedores por Caso de Uso
| Caso de Uso | STT | LLM | TTS |
|---|---|---|---|
| Inglés general (baja latencia) | Deepgram nova-2 | OpenAI gpt-4o-mini | ElevenLabs flash v2.5 |
| Conversaciones de alta calidad | Deepgram nova-2 | Anthropic Claude Sonnet | ElevenLabs multilingual v2 |
| Económico | Deepgram nova-2 | Google Gemini Flash | OpenAI tts-1 |
| Multilingüe (30+ idiomas) | Fish Audio transcribe-1 | Google Gemini Flash | Fish Audio s2 |
| Idioma chino | Alibaba Qwen | Moonshot Kimi | ElevenLabs multilingual v2 |
| Voz de marca personalizada | Deepgram nova-2 | OpenAI gpt-4o | Resemble AI |