MAI-Transcribe-2: Microsoft baja la transcripción a 0,10 USD/hora (y qué revisar antes de cambiar de proveedor)

MAI-Transcribe-2: Microsoft baja la transcripción a 0,10 USD/hora (y qué revisar antes de cambiar de proveedor)

30-09-2026 5:48:35
Compartir:

El 3 de septiembre de 2026 Microsoft AI presentó MAI-Transcribe-2, su nuevo modelo de reconocimiento de voz. El anuncio oficial lo resume en tres promesas: más precisión, más velocidad y el precio más bajo del mercado que publica la compañía: 0,10 USD por hora de audio (oferta de lanzamiento hasta fin de año, según Microsoft).

No es un modelo genérico más. Llega con diarización de hablantes, marcas de tiempo por palabra, sesgo de palabras clave, estilos de salida configurables, detección automática de idioma y soporte para 60 idiomas. Y llega justo cuando muchas empresas están midiendo otra vez el coste de pasar llamadas, reuniones y contenido a texto.

Este artículo se apoya en el comunicado de Microsoft AI, la ficha del modelo, la cobertura de VentureBeat y Unite.AI, y en cifras que esas fuentes atribuyen a Artificial Analysis. Sin proyecciones propias de ahorro ni promesas de adopción.

Qué lanzó Microsoft (y a qué precio)

Analista revisando un transcript impreso junto a monitores con etiquetas de agente y cliente
De 0,36 a 0,10 USD/hora en cinco meses: el precio deja de ser el debate

Según Microsoft AI, MAI-Transcribe-2 es su sistema de transcripción más capaz hasta la fecha. Frente a la generación anterior:

  • Idiomas: de 25 (abril, MAI-Transcribe-1) a 43 (junio, 1.5) y ahora 60.
  • Precio de lanzamiento: 0,10 USD/hora. MAI-Transcribe-1 salió a 0,36 USD/hora; VentureBeat calcula una bajada aproximada del 72% respecto a ese punto de partida.
  • Funciones incluidas en la base: diarización, timestamps a nivel de palabra, keyword biasing, estilos «verbatim» y «clean», code switching (Microsoft menciona pares como Hinglish y Spanglish) e identificación automática de idioma.
  • Disponibilidad: demo y acceso vía Microsoft Foundry y MAI Playground. Unite.AI señala que en Azure Speech figura en vista previa pública (sin SLA y no recomendado aún como carga de producción según la documentación citada).

VentureBeat pone el precio en contexto: para un volumen hipotético de 100.000 horas anuales de audio de call center, la factura a 0,36 USD sería 36.000 USD y a 0,10 USD, 10.000 USD. Es un ejemplo aritmético de la fuente, no un caso medido por Presticorp.

Qué dicen (y qué no) los benchmarks

Profesional comparando en un pizarrón modelos de voz por velocidad y precio
FLEURS 5,2% WER en 60 idiomas y 2º en Artificial Analysis: lea qué mide cada ranking

Microsoft hace tres afirmaciones de rendimiento que conviene leer por separado:

  • FLEURS (60 idiomas): promedio de 5,2% WER y primer puesto en ese promedio, según el anuncio. FLEURS es habla leída, no conversación espontánea. VentureBeat advierte que ese promedio subió respecto al 3,7% reportado para 1.5 sobre menos idiomas: al ampliar cobertura se meten lenguas de bajos recursos donde todos fallan más.
  • Artificial Analysis (AA-WER): Microsoft dice que define la frontera de Pareto precisión-latencia y que queda segundo en el ranking de error de palabra. Cifras recogidas en cobertura independiente: alrededor de 2,0% AA-WER y un factor de velocidad del orden de 400× (unas 10 segundos de inferencia por hora de audio en la ficha del modelo).
  • Velocidad frente a rivales nombrados: según evaluaciones de Artificial Analysis citadas por Microsoft, unas 10× más rápido que GPT-Transcribe, 7× que Scribe v2 de ElevenLabs y 5× que Gemini 3.5 Transcribe, con mayor precisión en esas comparaciones.

Lo que el WER no mide: calidad de diarización, streaming en tiempo real ni precisión por idioma concreto. Un transcript puede tener buen WER y asignar mal al hablante. Microsoft no publica en el anuncio una tasa de error de diarización ni lidera en silencio el tablero de streaming de Artificial Analysis, según señala VentureBeat.

Cómo evaluarlo esta semana (sin comprar el titular)

Dos personas comparando en una laptop dos versiones de una misma llamada de soporte
Pruebe su audio real: diarización, sesgo de palabras clave y estilo verbatim vs limpio

Si su operación ya paga transcripción —soporte, ecommerce con llamadas, clínicas, legal, subtítulos— un piloto corto basta para contrastar el marketing con su audio:

  • Use 20–50 grabaciones reales (ruido, solapamientos, acentos, Spanglish si aplica). Mida WER o, al menos, correcciones manuales por minuto.
  • Pruebe diarización y timestamps en reuniones o llamadas con dos o más voces. El valor está en poder editar y buscar, no solo en «sacar texto».
  • Active keyword biasing con su glosario (SKU, nombres de producto, marcas, términos clínicos). Es el atajo frente a especialistas de dominio.
  • Compare estilo verbatim vs limpio: compliance y legal suelen necesitar muletillas; marketing y subtítulos, no.
  • Pida por escrito el precio estándar tras la oferta, si hay streaming, residencia/retención de datos y si el audio alimenta entrenamiento futuro. VentureBeat marca esas exactamente como las preguntas abiertas del lanzamiento.

Qué implica para una pyme o un ecommerce

Persona planificando en un calendario de pared la migración de proveedor de transcripción
Antes de migrar: precio estándar, streaming, idiomas clave y tratamiento de datos

El movimiento encaja con la estrategia más amplia de Microsoft de sustituir, modalidad a modalidad, modelos de terceros por modelos MAI propios (Teams, documentación clínica vía Nuance, Azure Speech). Para quien compra el API, el mensaje práctico es otro:

  • El precio de entrada bajó lo suficiente como para que la transcripción deje de ser el freno en muchos flujos de atención y contenido.
  • Las funciones que antes se cobraban aparte (diarización, timestamps, 60 idiomas) vienen en el paquete base del anuncio.
  • La vista previa y la letra chica importan: sin SLA claro, sin fecha firme del precio post-promoción y sin métrica de diarización, no migre todo el volumen el primer día.

Si está montando o rehaciendo la capa digital donde el audio se convierte en tickets, pedidos o contenido —catálogo, atención, automatizaciones— en Presticorp aterrizamos eso por etapa: pymes, startups y ecommerce. La regla es la misma: primero un lote medido con su audio, después el contrato.

La sugerencia del escritor

MAI-Transcribe-2 no hay que leerlo solo como «otro modelo de voz». Hay que leerlo como Microsoft bajando el coste unitario de pasar audio a texto usable y empujando a que diarización y timestamps dejen de ser extras. Los benchmarks de FLEURS y Artificial Analysis sostienen una posición fuerte en precisión y velocidad; no sustituyen una prueba con sus llamadas.

Esta semana: elija un solo flujo (por ejemplo, 30 llamadas de soporte), córralo en su proveedor actual y en MAI-Transcribe-2, y anote errores, hablantes mal etiquetados y minutos de edición. Ese cuaderno vale más que el titular de 0,10 USD/hora.

Fuentes

Nota editorial: WER FLEURS 5,2%, AA-WER ~2,0%, factor de velocidad ~400×, multiplicadores 10×/7×/5×, precio 0,10 USD/hora y el historial 0,36 → 0,10 USD provienen de las fuentes citadas (3 de septiembre de 2026 y fichas asociadas). No se estiman ahorros propios ni resultados de adopción.

Compartir:

0 Comentarios

Deja un comentario

Landing pages especializadas

¿Proyecto totalmente personalizado? Contáctanos.

Si tu proyecto requiere una solución más enfocada, entra directo a la landing ideal para tu negocio y envíanos tu información en el formulario correspondiente.

Promo a la vista

Promociones más recientes

Ofertas vigentes del catálogo, de la más nueva a la más antigua.

Ver promociones
CrearPlantillas Ver catálogo