Microsoft випустила MAI-Voice-2-Flash — витрати на GPU вдалося знизити максимально на 89%

MSFT-2,24%
Key Takeaways
  • Microsoft випустила MAI-Voice-2-Flash і MAI-Image-2.5-Pro у публічний попередній перегляд 23 липня, досягнувши суттєвого зниження витрат.
  • Центри обслуговування клієнтів Microsoft досягли 89% зниження обчислювальних витрат після впровадження MAI-Voice-2-Flash для обробки мовлення.
  • MAI-Code-1-Flash може працювати на старіших GPU H100 і A100, зберігаючи продуктивність, що відповідає GPT-5.6, у задачах для Excel.

Microsoft 23 липня опублікувала дві нові моделі для публічного прев’ю: MAI-Image-2.5-Pro і MAI-Voice-2-Flash; водночас розкрила внутрішні дані, згідно з якими після того, як центр підтримки перейшов на MAI-Voice-2-Flash, витрати на обчислювальні потужності знизилися на 89%. Генеральний директор Microsoft Сатья Наделла заявив, що коли власні моделі демонструють рівність або перевершують передові рішення, він спрямовує на MAI трафік.

Функціональне призначення та ціноутворення MAI-Image-2.5-Pro і MAI-Voice-2-Flash

MAI-Image-2.5-Pro орієнтована на преміальне створення зображень; ціна становить 5 доларів за кожен мільйон token-вводу з тексту та 106 доларів за кожен мільйон token-виводу зображень; Bing Image Creator повністю перейшов на MAI-Image-2.5, а WPP глобальний директор із креативу Роб Райлі в заяві Microsoft назвав це «значним проривом для інструментів створення контенту».

MAI-Voice-2-Flash призначена для сценаріїв масової обробки голосу (зокрема кол-центрів), швидша за попередника вдвічі та має на 32% нижчу вартість; після заміни кол-центром цієї моделі витрати на обчислювальні потужності знизилися на 89%. Також у повідомленні одночасно розкрито результати розгортання Bing Image Creator, PowerPoint (GPU-витрати на 84% нижчі за GPT-Image-2), OneDrive (збережуваність +26%, затримка -25%) і Dragon Copilot (частота помилок -50%).

Конкретні досягнення з економії GPU-витрат

Microsoft у своїй заяві розкрила ефективність у таких сценаріях:

MAI-Voice-2-Flash (голос для кол-центру): витрати на обчислювальні потужності знижено на 89%; швидша за попередника вдвічі, вартість нижча на 32%

MAI-Image-2.5-Pro (PowerPoint): GPU-вартість нижча за OpenAI GPT-Image-2 на 84%

OneDrive після заміни моделі: збережуваність підвищено на 26%, затримку знижено приблизно на 25%

Dragon Copilot (MAI-Transcribe-1.5, медична транскрипція): обслуговує 170 тис. медичних працівників; за минулий квартал оброблено 28 млн записів пацієнтів; під час транскрипції та розпізнавання мов для 58 мов частота помилок порівняно знизилася на 50%

MAI-Code-1-Flash (GitHub Copilot): частка прийнятого коду вища за GPT-5.4 Mini і Claude Haiku 4.5 приблизно на 10%; споживання token менше на 10%; може працювати на GPU H100 і навіть A100

Логіка «віткового» бою Наделли та принцип спрямування трафіку на MAI замість передових моделей

Наделла в X опублікував допис під заголовком «Передове розповсюдження та контроль», де виклав модельну стратегію Microsoft: коли власні моделі демонструють рівність або перевершують передові замінники, він спрямовує трафік на MAI, щоб надавати послуги в масштабі та з нижчою вартістю. Підтримує цю стратегію методологія «hill-climbing»: щоб дані, моделі й продукт «вкладалися в узгоджену систему» та формували безперервний ітераційний «віток», а не покладалися на одноразове навчання, яке визначає, хто «вижив», а хто — ні.

Він також зазначив, що система оцінювання «має продовжувати рости вгору, навіть якщо прибрати будь-яку з моделей» — тобто зберігати пам’ять і навички поза моделями, формуючи справжній контроль, який Microsoft реально опановує. Після додаткового тренування MAI-Code-1-Flash у середовищі підкріпленого навчання Excel вона може зрівнювати GPT-5.6 у більшості завдань Excel на старіших GPU H100 і A100, водночас звільняючи найновіший кластер GB200 для тренування, а не для запитів сервісу.

Поширені запитання

Яке ціноутворення MAI-Image-2.5-Pro і MAI-Voice-2-Flash?

MAI-Image-2.5-Pro коштує 5 доларів за кожен мільйон текстових token-вводу та 106 доларів за кожен мільйон token-виводу зображень; доступна в публічному прев’ю в Azure. MAI-Voice-2-Flash швидша за попередника вдвічі та має на 32% нижчу вартість; деталі ціни відповідають офіційному повідомленню Azure.

На скільки максимум, за словами Microsoft, падає GPU-вартість після переходу на MAI-моделі?

Згідно з внутрішніми даними, оприлюдненими Microsoft: після переходу кол-центру на MAI-Voice-2-Flash витрати на обчислювальні потужності знизилися на 89%; після того як PowerPoint перейшов на MAI-зображувальну модель, GPU-вартість знизилася на 84% порівняно з GPT-Image-2; після заміни Dragon Copilot на MAI-Transcribe-1.5 частота помилок під час транскрипції та розпізнавання мов відносно знизилася на 50%. Втім усі наведені цифри походять із внутрішніх оцінок Microsoft і не є незалежними базовими тестами від третьої сторони.

Як корпоративні клієнти можуть використовувати Azure для MAI-методу навчання Microsoft?

Microsoft через продукти Foundry та Frontier Tuning у Azure дає корпоративним клієнтам можливість навчати моделі на власних даних для створення власних моделей; Microsoft підкреслює, що ці моделі навчаються на «чистих і відстежуваних корпоративних даних без перегонки третіми моделями», щоб відповісти на запитання щодо відповідності джерелам навчальних даних.

Застереження: інформація на цій сторінці може походити зі сторонніх джерел і надається виключно для ознайомлення. Вона не відображає позицію чи думку Gate і не є фінансовою, інвестиційною чи юридичною консультацією. Торгівля віртуальними активами пов’язана з високим ризиком. Будь ласка, не покладайтеся лише на інформацію з цієї сторінки під час прийняття рішень. Детальніше дивіться у Застереженні.
Прокоментувати
0/400
Немає коментарів