Коротко
Центральная проблема ИИ сейчас, sample efficiency: человек осваивает новую игру за пару попыток, а модели нужны десятки тысяч примеров. Спикеры выводят world model из теории управления: если модель мира идеальна (ньютоновская механика для посадки ракеты), обучающие сэмплы вообще не нужны, а если среда стохастична и недифференцируема (шахматы, го, руль, робот), приходится идти в «жуткий» RL. Через единый каркас S/T/A/R они показывают, почему AlphaGo с MCTS не масштабируется: при большом action space дерево поиска взрывается (для самоездящей машины пространство действий уже ~365 000, для робота ~10¹⁶). Спасение, video-diffusion как модель мира: обучить предсказание следующего кадра на дешёвом видео из YouTube, потом малым числом примеров добавить action conditioning и тренировать политику на синтетических «воображаемых» роллаутах (линия Dreamer, DreamerV4 добыл алмаз в Minecraft на синтетике). JEPA переносит всё в латентное пространство, чтобы не предсказывать пиксели, а нерешённое, PINNs не работают, SGD не даёт нулевого остатка, нет режима «сон/бодрствование» и быстрой адаптации.
Главный тезис
Модель мира, предсказание следующего состояния среды по текущему состоянию и действию, это то, чем занят неокортекс человека, и именно она (а не чистая политика «действие за действием») даёт sample efficiency и путь к AGI: она позволяет тренироваться на воображаемых роллаутах и планировать на test time.
Ключевые идеи
- 0:51, осталось решить две задачи: intelligence per watt и intelligence per sample; вторая это скорость поумнения с каждым новым примером.
- 1:14, вслед за Франсуа Шолле интеллект определяется как скорость приобретения навыка, а не сам навык; модели чудовищно плохи в приобретении навыка из малого числа сэмплов.
- 2:15, модели «прочли весь интернет», а человек ничтожную долю, но человек всё равно обобщает на ARC-AGI, где фронтир-модели проваливаются.
- 2:30, идеальная sample efficiency это ноль сэмплов: с идеальной моделью мира не нужно ходить в среду за данными.
- 3:03, перехват астероида и посадка ракеты SpaceX это идеальная модель мира (ньютоновская механика), система действует без сбора новых сэмплов.
- 5:00, исследование Ричардсона 1967: воображаемые броски улучшают попадания почти как реальные (23% против 24%), доказательство встроенной модели мира.
- 5:07, великое кортикальное расширение 10 млн лет назад существовало, чтобы всё лучше моделировать мир.
- 8:13, функция перехода s_{t+1} = f(s_t, u_t) это и есть модель мира; в дифференцируемом мире политику считают через model predictive control и выпуклую оптимизацию.
- 13:12, как только появляется противник (недифференцируемость, стохастика), приходится в RL: value/policy iteration, DQN, actor-critic, всё это способы моделировать недифференцируемый стохастический процесс.
- 16:57, целевое совместное распределение p(s_{t+1}, a_t | s_t) факторизуется на политику и модель мира (θ); обучать их можно раздельно или совместно (world-action model).
- 19:11, AlphaGo с MCTS не масштабируется: ~24 000 вызовов модели на один ход, требуется маленькое action space и детерминированная среда.
- 37:51, бесконечное пространство состояний (пиксели, дорога) ужимается conv-net'ом в латент; 10 лет deep learning научили сжимать быстро.
- 17:56, линия Dreamer: сначала модель мира на дешёвом видео, потом малым числом примеров добавляют action conditioning и получают embodiment.
- 51:53, DreamerV4 добыл алмаз в Minecraft на чисто синтетических роллаутах, это показывает силу обучения политики в «нейросимуляции».
- 1:00:03, JEPA предсказывает не пиксели, а латенты; наивный лосс схлопывается в нули, спасают SIGReg/VICReg, поддерживающие гауссово распределение латентов.
Почему это важно
Ставка идёт на то, кто первым доведёт роботов и полное самоуправление до продакшена, и world models переопределяют экономику этой гонки: вместо дорогой teleop-разметки (для робота она мучительна, для машины эксклюзивна у Tesla с её флотом) можно тренироваться на бесплатном океане видео из YouTube и Flickr. Waymo и Tesla FSD названы как разные полюса зрелости; Wayve вложила ~1.5 млрд в GAIA под ту же идею для авто, NVIDIA двигает Dream Zero для роботов, Dreamer-линия (Хафнер) задаёт метод, а video-diffusion модели (Sora, Seedance, Wan) становятся готовыми модельными мирами. Выигрывают те, у кого есть данные и компьют, чтобы «доплатить» за Rosie the robot; проигрывают чистые VLA-подходы без модели мира.
Идеи
- Perfect world model = ноль сэмплов звучит абсурдно, но NASA и SpaceX уже так работают.
- «Вкус» (taste) в продукте это предсказание, что другим понравится, то есть модель мира, натренированная за 10 лет ошибок предпринимательства.
- У Билла Гейтса, Джобса и Дженсена по ~50 лет «опыта моделирования мира» о том, чего хотят люди.
- Естественный язык модели тянут удивительно хорошо без явной модели мира, а в робототехнике и вождении этот трюк ломается.
- Ценность состояния (value) задаёт «конус» безопасных траекторий: пролететь над домами при посадке ракеты, низкая ценность.
- В шахматах гигантское пространство состояний, но реально достижимых позиций через 4 хода мало, и это делает задачу трактабельной.
- Трактабельность определяет не размер state space, а размер action space (комбинаторный взрыв дерева).
- Гипотетическое го 1000×1000 даёт ~60 млн вызовов модели на один ход, значит модель обязана быть крошечной.
- MCTS-дерево выбрасывают после каждого хода, но вероятности обхода из него отличный обучающий сигнал (слегка «круговая» логика).
- UCB балансирует эксплуатацию (Q-value) и эксплорацию (обратно счётчику посещений), чтобы не быть близоруко жадным.
- В Индии самоездящая машина по строгому Ньютону выбрала бы «не двигаться», потому что любое движение = столкновение; надо моделировать, что люди адаптируются.
- У всех, кроме Tesla, есть кадры вождения, но нет действий водителя; это и есть конкурентный ров Tesla.
- Cross-embodiment gap: политика с Model X не переносится на Model 3 из-за разной массы и аэродинамики; данные шардят по типу машины.
- VLA = LLM без токенайзер-головы, вместо токена выдаёт действие; аналог next-token prediction.
- Утверждение: мозг это оптимизатор, а не модель; он вызывает модели, но сам же и оптимизирует.
- Ни один интеллектуальный вид не обходится без сна (осьминоги, дельфины, слоны), при том что во сне тебя съедают, значит выгода сна огромна.
- Hippocampal sharp-wave ripples проигрывают дневные спайки в обратном порядке ~7 раз, похоже на дообучение и консолидацию памяти.
- PINNs не работают: если почти все данные это «едем по дороге», модель при въезде в дом «дорисует» шоссе и скажет «ты не разбился».
- SGD не сводит остаток к нулю даже на синусоиде, значит высокоточную физику тел не смоделировать точно.
- Стеф Карри нашёл «мёртвую точку» на площадке по отскоку мяча, эталон точности человеческой модели мира.
- Sam Altman говорит, что появится архитектура производительнее трансформера; трансформер не сжимает временную ось, тащит всё.
- Эпидермис детектит тактильность, сдвиговую силу и температуру повсюду; у роботов один сенсор без трения и температуры.
- Онемевшими руками нельзя завязать шнурки, без тактильной обратной связи управление рушится.
- GenCast применяет ту же диффузионную схему как «модель мира для погоды всего мира» (лаг порядка 2, AR2).
- Squint-test: если прищуриться, VLA + модель мира + совместное test-time планирование выглядят ближе к мозгу, чем авторегрессивный LLM.
Инсайты
- Sample efficiency упирается не в объём данных, а в наличие внутренней модели среды: с идеальной моделью предельная ценность нового сэмпла стремится к нулю.
- Узкое место интеллекта это action space, а не state space: сжатие состояний решено deep learning'ом, а комбинаторика действий множит стоимость планирования астрономически.
- Дифференцируемость среды определяет метод: где она есть, работает дешёвая выпуклая оптимизация, где нет, начинается дорогой и хрупкий RL.
- Модель мира дважды окупается: как генератор синтетических данных для обучения и как симулятор для планирования в реальном времени.
- Перенос идеи латентного предсказания (stable diffusion, JEPA, генеративные модели молекул) повторяется в deep learning снова и снова с одним и тем же набором трюков против коллапса.
- Конкурентное преимущество в embodied AI смещается от алгоритма к обладанию парой «состояние-действие»: у кого флот и teleop, у того ров.
- Биология служит и мотивацией, и дорожной картой: неокортекс, сон и hippocampal replay читаются как обучение, консолидация и test-time adaptation.
- Обобщение между воплощениями (cross-embodiment) фундаментально ограничивает переиспользование политик: физика тела меняется, и данные приходится сегментировать.
- Разрыв между «работает в демо» и «работает всегда» держится на распределении данных: редкие катастрофические состояния недопредставлены, и сеть их галлюцинирует безопасными.
- Текущие архитектуры лишены двух человеческих механизмов, быстрой out-of-distribution адаптации и офлайн-консолидации во сне, и это, вероятно, архитектурный, а не датасетный предел.
Цитаты
«One of the biggest open problems in AI right now is how to solve sample efficiency», 0:00 Одна из крупнейших нерешённых проблем в ИИ сейчас, как решить sample efficiency
«the perfect sample efficiency would be zero samples», 2:30 идеальная sample efficiency это ноль сэмплов
«it's called Newton's second law of motion», 3:03 это называется второй закон Ньютона
«what is taste is like predicting that other people are going to like this thing», 4:15 что такое вкус, это предсказание, что другим людям это понравится
«I have to resort to this awful area called reinforcement learning, which is just super brutal», 13:12 приходится идти в жуткую область под названием reinforcement learning, она просто зверская
«why can't we just scale up alpha go to like solve all the problems», 19:11 почему нельзя просто отмасштабировать AlphaGo и решить все задачи
«you like, you throw it away after you make the move», 32:23 ты его просто выбрасываешь после того, как сделал ход
«imagine we were driving a car and like you took like 60 seconds to like turn the steering wheel everyone's dead», 36:09 представь, мы едем на машине и ты 60 секунд поворачиваешь руль, все мертвы
«unless you're Tesla», 41:14 если ты не Tesla
«the main thing that I believe is that this is required for agi», 44:46 главное, во что я верю, это необходимо для AGI
«it's the first paper to mine diamonds in minecraft», 51:53 это первая работа, добывшая алмазы в Minecraft
«This collapses hard», 1:00:03 Это жёстко схлопывается
«I think that the brain is the optimizer, not the model», 1:10:09 я думаю, мозг это оптимизатор, а не модель
«There's no intelligent species that we're aware of that have any amount of intelligence that don't sleep», 1:10:20 нам не известно ни одного интеллектуального вида хоть с каким-то интеллектом, который не спит
«we did need two wings», 1:09:31 два крыла нам всё-таки понадобились
«26 will be the year of the robot», 1:03:50 26-й станет годом робота
Факты
- Исследование Ричардсона 1967 года (cog-sci): группа реальных бросков улучшилась на ~24%, группа воображаемых на ~23% против контроля (спикер оговаривается «I think it was like»).
- Великое кортикальное расширение мозга датируется ~10 млн лет назад; нейробиолог Шоу Друкманн (Stanford) считает его целью улучшение моделирования мира.
- AlphaGo: 800 MCTS-симуляций на ход, доска 19×19 (~361 позиция), глубина ~30, итого ~24 000 вызовов модели на один ход.
- Гипотетическое го 1000×1000: action space ~1 млн, нужно ~2 млн симуляций × глубина 30 ≈ 60 млн вызовов на ход.
- Самоездящая машина: упрощённо руль 0–365° × 10 градаций резкости ≈ 365 000 вариантов action space.
- Робот-манипулятор: 6-осевая рука + захват ≈ 16 степеней свободы, action space ~10¹⁶.
- Юрген Шмидхубер, статья «World Models», опубликована в мае 2018 (тогда RNN, среды OpenAI Gym: car racing, Doom).
- Данияр Хафнер выпустил Dreamer v1 около ноября 2018; DreamerV4 (фокус на Minecraft) назван кульминацией ~7 лет работы.
- Wayve, GAIA: спикер называет ~1.5 млрд долларов на реализацию этой идеи для самоуправления.
- Dream Zero для роботов (упомянута работа, связанная с NVIDIA): инициализация из open-source video-diffusion Wan + ~500 часов teleop-данных.
- Статья из University of Washington: каждая кортикальная область оценивает латентные сенсорные состояния и действия, а кортекс предсказывает последствия действий.
- Стэнфордский курс «Decision Making Under Uncertainty», основной RL-курс, где преподаёт спикер; он же слушал CS229 у Эндрю Ына в 2012.
- Lane McIntosh (играл в хоккей со спикером в Стэнфорде) сейчас руководит Tesla FSD; спикер «поставил бы деньги», что данные шардят по типу машины (гипотеза, не факт).
- Стеф Карри нашёл «мёртвую точку» на площадке по отскоку мяча, приведено как анекдот о точности модели мира.
Источники
- François Chollet, определение интеллекта как скорости приобретения навыка; тест ARC-AGI.
- Юрген Шмидхубер, статья «World Models» (2018).
- Данияр Хафнер, серия статей Dreamer (v1–v4).
- GAIA (Wayve), модель мира для самоуправления.
- Dream Zero, перенос концепции Dreamer на роботов (инициализация из Wan video-diffusion).
- GenCast, диффузионная модель прогноза погоды («модель мира для мира»).
- LeWM (LE World Model), латентная модель мира на идее JEPA.
- JEPA (Joint Embedding Predictive Architecture), Yann LeCun; методы против коллапса SIGReg и VICReg.
- Статья University of Washington о кортексе как предсказателе последствий действий.
- Video-diffusion / flow-matching модели: Sora, Seedance, Wan.
- Исследование Ричардсона (1967) о ментальной тренировке бросков.
- Нейробиолог Шоу Друкманн (Stanford).
- Документальный фильм об AlphaGo (спикер настойчиво рекомендует).
- Sam Altman, тезис об архитектуре производительнее трансформера.
Рекомендации
- Посмотреть документальный фильм об AlphaGo, «такой потрясающий документальный фильм, всем рекомендую».
- Исследователям названы открытые фронты: заставить работать PINNs, поднять fidelity модели мира, решить быструю test-time adaptation и out-of-distribution предсказание, дать роботам богатую тактильную обратную связь.
Итог
Дорога к sample-efficient интеллекту и AGI идёт не через модель, которая выдаёт действия напрямую, а через модель мира, которая предсказывает следующее состояние среды, ровно так, как это делает неокортекс, и позволяет учиться на воображаемом и планировать на лету.


