Redacción, 19 de septiembre.- xAI lanzó Grok Voice Transcribe 2.0, su nuevo modelo de reconocimiento de voz, con una mejora de precisión que la compañía cifra en el doble respecto a la generación anterior. El sistema está diseñado para convertir conversaciones y grabaciones de audio en texto y ya puede utilizarse a través de la API de reconocimiento de voz de la compañía.
El modelo mantiene el precio de su antecesor: 0,10 dólares por hora de audio para las transcripciones por lotes y 0,20 dólares por hora para el procesamiento en tiempo real.
xAI también anunció que la nueva versión será próximamente el modelo predeterminado de su API, mientras que Grok Voice Transcribe 1.0 será retirado en las próximas semanas.
Grok Voice Transcribe 2.0 se basa en el modelo de audio que xAI utiliza para Grok Voice. La compañía asegura que esta tecnología ya procesa decenas de miles de llamadas de atención al cliente cada día, transcribe millones de horas de narraciones de vídeo y permite ejecutar agentes de voz en productos físicos, incluido el asistente Grok integrado en vehículos Tesla.
Para desarrollar la nueva versión, xAI utilizó grabaciones de audio en directo, con ruido de fondo y en diferentes idiomas y entornos. Posteriormente, aplicó procesos de postentrenamiento para mejorar el comportamiento del modelo en situaciones habituales de uso.
Según la compañía, Grok Voice Transcribe 2.0 ocupa el primer puesto en precisión entre 32 modelos de transmisión analizados en la clasificación pública de Artificial Analysis. En sus propias pruebas, xAI también comparó el sistema con modelos como Gemini 3.5 Transcribe, MAI-Transcribe-2, ElevenLabs Scribe v2, Deepgram Nova-3 y Whisper Large v3.
Las pruebas internas utilizaron cuatro tipos de audio: llamadas de atención al cliente, conversaciones con Grok, información hablada como códigos y direcciones de correo electrónico, y comandos de voz breves en distintos idiomas.
xAI señala que el mayor avance frente a Grok Voice Transcribe 1.0 se encuentra en la transcripción multilingüe. El modelo puede trabajar con decenas de idiomas, detectar automáticamente cuál se está utilizando y seguir una conversación en la que el hablante cambia de idioma.
Esta capacidad resulta especialmente relevante para comandos cortos, donde existe poco contexto para identificar la lengua. En las pruebas de xAI con frases breves de asistentes de voz en 19 idiomas, la tasa de error de palabras pasó del 20,6 % en la versión anterior al 6,8 % con Grok Voice Transcribe 2.0.
La API permite utilizar el modelo tanto para archivos de audio previamente grabados como para transcripciones en tiempo real. Entre sus funciones se encuentran las marcas de tiempo y las puntuaciones de confianza a nivel de palabra, la identificación de diferentes hablantes y la transcripción de hasta ocho canales de audio.








