Microsoft lanza MAI-Voice-2-Flash, con una reducción del coste de la GPU del 89%

MSFT-2,24%
Key Takeaways
  • Microsoft lanzó MAI-Voice-2-Flash y MAI-Image-2.5-Pro en vista previa pública el 23 de julio, con importantes reducciones de costes.
  • Los centros de atención al cliente de Microsoft lograron una reducción del 89% en el coste de computación tras adoptar MAI-Voice-2-Flash para el procesamiento de voz.
  • MAI-Code-1-Flash puede ejecutarse en GPUs más antiguas, como H100 y A100, manteniendo el rendimiento de GPT-5.6 en tareas de Excel.

Microsoft publicó el 23 de julio dos modelos nuevos en vista previa pública: MAI-Image-2.5-Pro y MAI-Voice-2-Flash; al mismo tiempo, dio a conocer datos internos: al cambiar el centro de atención al cliente por MAI-Voice-2-Flash, el coste de cómputo se reduce en un 89%. El CEO de Microsoft, Satya Nadella, afirma que, cuando el rendimiento de sus propios modelos iguala o supera a las propuestas punteras, dirige el tráfico hacia MAI.

Enfoque funcional y precios de MAI-Image-2.5-Pro y MAI-Voice-2-Flash

MAI-Image-2.5-Pro se orienta a la generación avanzada de imágenes; tiene un precio de 5 USD por cada millón de tokens de entrada de texto y 106 USD por cada millón de tokens de salida de imágenes. Bing Image Creator ya se ha sustituido por completo por MAI-Image-2.5; el director global de creatividad de WPP, Rob Reilly, lo calificó en el anuncio de Microsoft como «un gran avance para las herramientas de medios generativos».

MAI-Voice-2-Flash se orienta a escenarios de procesamiento masivo de voz (como centros de atención al cliente); es el doble de rápido que el modelo anterior y tiene un coste un 32% más bajo. Tras cambiar el centro de atención al cliente a este modelo, el coste de cómputo se reduce en un 89%. El anuncio también divulgó los resultados de despliegue de Bing Image Creator, PowerPoint (el coste de GPU es un 84% más bajo que el de GPT-Image-2), OneDrive (tasa de almacenamiento +26%, latencia -25%) y Dragon Copilot (tasa de error -50%).

Resultados concretos del ahorro de costes de GPU

Microsoft reveló los resultados por escenario en el anuncio, como sigue:

MAI-Voice-2-Flash (voz en centros de atención al cliente): el coste de cómputo se reduce en un 89%; el doble de rápido que el modelo anterior, con un coste un 32% menor

MAI-Image-2.5-Pro (PowerPoint): el coste de GPU es un 84% más bajo que el de OpenAI GPT-Image-2

OneDrive al cambiar de modelo: la tasa de almacenamiento aumenta 26% y la latencia se reduce cerca de un 25%

Dragon Copilot (MAI-Transcribe-1.5, transcripción médica): da servicio a 170.000 profesionales sanitarios; el trimestre pasado procesó 28 millones de registros de pacientes; para 58 idiomas, la tasa de error en la transcripción y en el reconocimiento del idioma se reduce en un 50% en comparación

MAI-Code-1-Flash (GitHub Copilot): la tasa de adopción del código es aproximadamente un 10% superior a la de GPT-5.4 Mini y Claude Haiku 4.5; el consumo de tokens es un 10% menor; puede ejecutarse en GPU H100 e incluso A100

Lógica de tráfico de la estrategia de “rueda volante” de Nadella y la sustitución de modelos punteros por MAI

Nadella publicó en X un post titulado «Difusión avanzada y control», en el que expone la estrategia de modelos de Microsoft: cuando el rendimiento de los modelos propios iguala o supera a las alternativas punteras, se dirige el tráfico hacia MAI para ofrecer servicios a gran escala con un coste menor. La estrategia se sustenta en la metodología «hill-climbing»: hacer que los datos, el modelo y el producto formen un «sistema acoplado» que itere continuamente en una rueda volante, en lugar de depender de una sola sesión de entrenamiento para decidir el éxito o el fracaso del modelo.

También señaló que el sistema de evaluación «debería seguir avanzando incluso si se elimina cualquier modelo»—dejando la memoria y las habilidades fuera del modelo para formar el control que Microsoft realmente domina. Tras reforzar MAI-Code-1-Flash en el entorno de aprendizaje por refuerzo de Excel, puede ejecutarse en GPU más antiguas H100 y A100; en la mayoría de las tareas de Excel, iguala a GPT-5.6, al tiempo que libera el clúster más reciente GB200 para entrenamiento en vez de solicitudes de servicio.

Preguntas frecuentes

¿Cuánto cuestan MAI-Image-2.5-Pro y MAI-Voice-2-Flash?

MAI-Image-2.5-Pro cuesta 5 USD por cada millón de tokens de entrada de texto y 106 USD por cada millón de tokens de salida de imágenes; ya está disponible en vista previa pública en Azure. MAI-Voice-2-Flash es el doble de rápido que su predecesor, con un 32% menos de coste; los detalles del precio se ajustan al anuncio oficial de Azure.

¿Según Microsoft, cuánto puede bajar el coste de GPU como máximo tras cambiar a los modelos MAI?

Con base en los datos internos publicados por Microsoft, tras cambiar el centro de atención al cliente a MAI-Voice-2-Flash, el coste de cómputo se reduce en un 89%; al cambiar PowerPoint a un modelo de imagen MAI, el coste de GPU se reduce en un 84% en comparación con GPT-Image-2; tras cambiar Dragon Copilot por MAI-Transcribe-1.5, la tasa de error relativa en la transcripción y en el reconocimiento del idioma se reduce en un 50%. Sin embargo, todas las cifras anteriores provienen de evaluaciones internas de Microsoft, y no de pruebas independientes de referencia de terceros.

¿Cómo pueden los clientes empresariales usar el método de entrenamiento de Microsoft MAI mediante Azure?

Microsoft, a través de los productos Foundry y Frontier Tuning de Azure, permite que los clientes empresariales entrenen modelos personalizados con sus propios datos. Microsoft subraya que estos modelos se entrenan con «datos empresariales limpios y rastreables de grado empresarial, sin destilación de modelos de terceros», para abordar problemas de cumplimiento relacionados con el origen de los datos de entrenamiento.

Aviso legal: La información en esta página puede provenir de fuentes de terceros y es solo para referencia. No representa las opiniones ni puntos de vista de Gate y no constituye asesoramiento financiero, de inversión ni legal. El comercio de activos virtuales implica un alto riesgo. No te bases únicamente en la información presentada en esta página para tomar decisiones. Para más detalles, consulta el Aviso legal.
Comentar
0/400
Sin comentarios