Tres tipos de motores potentes
Elige la arquitectura perfecta para tu caso de uso. Desde flexibilidad total hasta velocidad extrema.
Tubería (Pipeline)
STT → LLM → TTS. Método probado y flexible.
El modo de procesamiento en cadena transcribe primero las palabras a texto, procesa con el modelo de lenguaje y convierte la respuesta a audio.
Voz a Voz (Multimodal)
Generación directa de voz a voz sin texto intermedio.
Omite la transcripción y síntesis por separado. Utiliza un modelo multimodal que escucha y habla directamente para un flujo natural.
Modo Dualplex
Híbrido: Inteligencia de voz a voz + síntesis de voz premium.
Combina lo mejor de ambos mundos: la latencia de voz a voz con la calidad de síntesis de ElevenLabs.