Photon-1 от Induction Labs превосходит Google Gemini при использовании вычислений в 30 раз меньшего объёма

Induction Labs представила Photon-1 23 июля 2026 года — первое из так называемых «imagination models» («моделей воображения»), нового класса базовой архитектуры, предназначенного для обучения на видео интернет-масштаба без размеченных примеров действий в ходе дообучения. 106-миллиардный параметрический разреженный трансформер «смесь экспертов» с 5 миллиардами активных параметров был обучен примерно на 575 миллионов кадров записей компьютерного экрана — это эквивалент 18 лет видео, снятого с частотой один кадр в секунду. Компания утверждает, что Photon-1 превосходит Gemini 3.1 Flash-Lite от Google на внутренних бенчмарках по использованию компьютера, несмотря на то, что он обучался как минимум на 30 раз меньшем объёме вычислений, и при этом стоит примерно в три раза меньше за миллион токенов: $0,11 против $0,36 у Gemini. Модель бросает вызов давнему допущению в ИИ: что обучение машины действовать требует тщательно размеченных примеров каждого действия, которое она должна выполнять. Подход Induction Labs устраняет критическое узкое место, позволяя машинам осваивать процедурные знания просто наблюдая неразмеченное видео интерфейсов компьютера в работе.

Photon-1 Архитектура и спецификации обучения

Photon-1 обучали с нуля в течение одной эпохи на датасете, полученном путём дистилляции из первоначального индекса двух миллиардов публично доступных видео: его сократили примерно до двух миллионов записей экрана и убрали избыточные кадры с помощью внутренней модели детекции ключевых кадров. Процесс обучения потребовал примерно 30 000 NVIDIA H200 GPU-часов и 4,4 × 10²² FLOPs. Каждый видеокадр сжимается в 960 дискретных токенов с помощью конечного скалярного квантования, занимая всего 2,2 килобайта — примерно в 100 раз меньше, чем существующие представления для OCR и мультимодальные решения — при сохранении текста, расположения и изменений состояния. Дифференциальный латентный энкодер обрабатывает кадры попарно, кодируя различия между последовательными состояниями, а не абсолютное содержимое кадра. Модель предсказывает будущие кадры авторегрессионно в обученном пространстве представлений, используя целевую функцию next-latent-token. Результаты бенчмарков, на которые ссылается Induction Labs, сопровождаются важными оговорками: бенчмарк внутренний и не опубликован, то есть результаты нельзя независимо воспроизвести, а оценка вычислений Gemini — это собственная консервативная проекция Induction Labs, а не верифицированные данные.

Сжатие и процесс дообучения «моделей воображения»

Превращение наблюдательных знаний в работающего агента потребовало второго этапа. Induction Labs дообучила Photon-1 менее чем на 35 000 размеченных траекторий использования компьютера, чтобы научить правильному формату действий, добавив специальные токены, которые позволяют модели выдавать команды клавиатуры и мыши. На инференсе система работает в два шага: сначала она «воображает» следующее состояние, которое продвинет выполнение задачи, затем генерирует действие, предназначенное для достижения этого состояния. Далее последовало онлайн-обучение с подкреплением: реальные запуски (rollouts) в реальном времени на виртуальных машинах Linux в пяти средах рабочего стола, программно верифицированные исходы и сигналы вознаграждения, которые направляли дальнейшее улучшение. При дообучении на 20 000 партиях турнирных шашек Photon-1 обошла и базовую модель с vision-энкодером, и базовую модель языка того же размера — как в имитации мира, так и по качеству ходов. На 10 000 синтетически сгенерированных бильярдных играх она достигла средней абсолютной ошибки 0,47 в предсказании позиции шара по сравнению с 1,15 для базовой LLM и 1,44 для vision-базовой. Модель также уловила поведенческие паттерны человека из данных предобучения: она научилась формулировать промпты клону ChatGPT внутри виртуальной машины, проверять его ответы и направлять диалог, пока задача не будет выполнена.

Развитие world model в 2026 году

Photon-1 появляется в момент, когда индустрия ИИ смещается в сторону того, что исследователи в целом называют «world models» («модели мира») — систем, которые строят внутренние представления о том, как развивается среда в ответ на действия, а не просто предсказывают текст или генерируют отдельные фрагменты видео. В мае Google DeepMind выпустила Genie 3 — интерактивную world model в реальном времени, способную генерировать устойчивые 3D-среды со скоростью 24 кадра в секунду по тексту или изображениям, с самообучаемой физикой вместо жёстко заданных правил. Платформа NVIDIA Cosmos, предлагающая открытые по весам базовые world model, обученные на 20 миллионах часов данных реального мира, превысила два миллиона загрузок и внедряется компаниями в робототехнике, включая 1X, Figure AI и Agility, для генерации синтетических тренировочных данных. World Labs Фей-Фей Ли запустили Marble — коммерчески доступную систему для создания редактируемых 3D-миров из текста, изображений или видео. AMI Labs Яна Лекуна — как сообщается, оцененная в €3 миллиарда до выпуска продукта — привлекла €500 миллионов, чтобы развивать архитектуры в стиле JEPA, которые учатся абстрактным представлениям, предсказывая в латентном пространстве, а не в пикселях. Другие заметные события включают Gen-4.5 от Runway: компания прямо позиционирует её как «world model» с реалистичной физикой, а DreamZero — world action model с 14 миллиардами параметров — продемонстрировала сильный перенос между телесностью (cross-embodiment transfer) от человеческого видео к управлению роботом, используя только визуальную информацию без разметки действий.

Часто задаваемые вопросы

Что Induction Labs представила 23 июля 2026 года?

Induction Labs представила Photon-1 — первое «imagination model»: разреженный трансформер «смесь экспертов» с 106 миллиардами параметров и 5 миллиардами активных параметров, обученный примерно на 575 миллионах кадров неразмеченных записей компьютерного экрана. Модель учится использовать компьютер, наблюдая видео без разметки действий в ходе дообучения.

Как производительность Photon-1 соотносится с Google Gemini 3.1 Flash-Lite?

Induction Labs утверждает, что Photon-1 превосходит Gemini 3.1 Flash-Lite от Google на внутренних бенчмарках по использованию компьютера, несмотря на то, что он обучался как минимум на 30 раз меньшем объёме вычислений. Компания сообщает, что стоимость инференса составляет $0,11 за миллион токенов против $0,36 у Gemini. Бенчмарк внутренний и не опубликован, а оценка вычислений Gemini — это собственная проекция Induction Labs.

Какие события в развитии world model произошли в 2026 году?

В мае Google DeepMind выпустила Genie 3 — интерактивную world model в реальном времени, генерирующую устойчивые 3D-среды со скоростью 24 кадра в секунду. Платформа NVIDIA Cosmos превысила два миллиона загрузок и внедряется компаниями в робототехнике, включая 1X, Figure AI и Agility. World Labs Фей-Фей Ли запустили Marble для создания редактируемых 3D-миров. AMI Labs Яна Лекуна привлекла €500 миллионов, чтобы развивать архитектуры в стиле JEPA.

Дисклеймер: Информация на этой странице может быть получена из источников третьих сторон и предоставляется только для ознакомления. Она не отражает взгляды или мнения Gate и не является финансовой, инвестиционной или юридической рекомендацией. Торговля виртуальными активами связана с высоким риском. Пожалуйста, не основывайте свои решения исключительно на данных этой страницы. Подробнее смотрите в Дисклеймере.
комментарий
0/400
Нет комментариев