Коротко
Ричард Саттон, один из отцов reinforcement learning и лауреат премии Тьюринга, считает LLM тупиковой веткой: они имитируют людей, а не понимают мир. У них нет цели, а без цели нет понятия «правильного действия», значит нет ground truth, значит нет и настоящего обучения. Настоящий интеллект приходит из опыта: агент действует, видит последствия, корректирует поведение ради награды и учится непрерывно во время обычной жизни, а не в отдельной фазе тренировки. Саттон отвергает даже идею LLM как «хорошего prior» для последующего RL: prior без определения истины бессмысленен. Он ставит белку выше человека как объект для копирования интеллекта, отрицает роль имитации и supervised learning в природе и утверждает, что нынешняя обобщаемость моделей это заслуга людей-исследователей, а не самих алгоритмов. Разговор заканчивается спокойным принятием «преемственности»: переход к designed-интеллекту Саттон называет четвёртой великой стадией вселенной и предлагает ею гордиться.
Главный тезис
Интеллект это способность достигать целей через опыт (действие → последствие → награда), поэтому LLM, которые лишь имитируют людей и не имеют ни цели, ни предсказания о мире, стартуют не с того конца, а масштабируемым в итоге окажется обучение из опыта.
Ключевые идеи
- 1:35: RL это базовый ИИ, а задача интеллекта понять свой мир; LLM же заняты копированием людей, а не выяснением, что делать.
- 2:35: у LLM нет модели мира: они имитируют людей, у которых модель есть, а сами предсказывают лишь что скажет человек, а не что случится в реальности.
- 3:03: по Тьюрингу нужна машина, которая учится из опыта: делаешь, видишь результат, учишься на этом.
- 5:09: prior невозможен без ground truth; в языковой рамке нет определения «правильного ответа», значит нет истины, для которой prior служил бы подсказкой.
- 7:46: цель это суть интеллекта (по определению Маккарти интеллект это вычислительная часть способности достигать целей), а next-token prediction целью не служит: предсказал токены и доволен собой, а мир не изменил.
- 7:20: LLM не удивляется реальности: происходит неожиданное, он не меняется, потому что нет предсказания о последствиях своих действий.
- 9:15: математика это вычисление и планирование, а не эмпирический мир; успех на IMO не переносится на задачу выучить последствия в реальном мире, которую нужно прожить.
- 10:28: спорно, Bitter Lesson ли LLM: они масштабируют вычисления, но и набиты человеческим знанием, а такие системы исторически проигрывают тем, кто учится из опыта.
- 18:47: supervised learning не существует в природе: белки не ходят в школу, у животных есть предсказание и trial-and-error, но нет примеров желаемого поведения.
- 0:19: поняв белку, мы почти у цели; язык это тонкая плёнка на поверхности, а искать особенность именно в человеческом это распространённая ошибка.
- 30:09: гипотеза большого мира: мир так огромен, что нельзя вложить всё заранее, поэтому агент обязан доучиваться на ходу под конкретных людей и их идиосинкразии.
- 32:50: агент состоит из четырёх частей: политика, value-функция, восприятие и transition-модель мира, и модель учится богато из всех ощущений, а не только из награды.
- 36:35: трансфера нет нигде: хорошая генерализация в моделях это результат ручной подгонки людьми, у deep learning нет своих механизмов для этого, а новое знание катастрофически стирает старое.
- 43:57: «слабые методы» (поиск и обучение на общих принципах) полностью победили «сильные» символьные, встроенные человеческим знанием.
- 54:47: преемственность к цифровому интеллекту неизбежна; Саттон разворачивает четырёхчастный аргумент и предлагает гордиться этим как стадией вселенной.
Почему это важно
Спор идёт о фундаменте следующей волны ИИ и о том, чьи ставки верны. Весь мейнстрим (лаборатории вроде OpenAI, Google DeepMind, инвесторы, вливающие миллиарды в масштабирование трансформеров) исходит из того, что LLM это скэффолд, поверх которого достроят обучение из опыта. Саттон, автор самого влиятельного эссе индустрии Bitter Lesson и изобретатель TD-learning и policy gradients, говорит, что стартовая точка выбрана неправильно и весь фарш с человеческим знанием будет съеден системами, которые учатся из чистого опыта. Если он прав, деньги льют не туда, и выиграют те, кто строит continual-learning агентов с нуля. Если правы оппоненты, его «era of experience» надстроится над LLM и спор окажется семантическим.
Идеи
- Мимикрия под человека это копирование носителя модели мира, но не построение своей модели.
- Спросить LLM «что ответит юзер» и получить ответ не то же, что иметь предсказание: настоящее предсказание меняет тебя при неожиданности.
- Next-token prediction это предсказание своего действия, а не отклика мира на это действие.
- Награда в experiential-парадигме произвольна: шахматы выиграть, белке орехи, животному избегать боли и искать удовольствие.
- Отдельным компонентом награды должна быть внутренняя мотивация: рост понимания своей среды.
- TD-learning решает проблему редкой награды: value-функция предсказывает долгий исход, и её рост немедленно подкрепляет ход.
- Стартап с выплатой раз в 10 лет и взятие фигуры в шахматах это одна и та же механика на разном масштабе.
- Знание в этой парадигме это утверждения о потоке опыта, поэтому его можно проверять сверкой с потоком и учить непрерывно.
- Дети первые полгода имитируют звуки, но не действия: у движений глаз и рук нет образца для подражания.
- Имитация у людей реальна, но это тонкая надстройка над базовым trial-and-error, а не отдельный механизм обучения животных.
- Школа и формальное обучение это исключение, на котором нельзя строить теорию научения.
- Слово «модель» Саттон не любит для сети: лучше «сеть», а «модель» приберечь для transition-модели мира.
- Цифровой интеллект можно обучить один раз и скопировать в следующий, тогда как каждый ребёнок учится миру заново.
- MuZero это не общий интеллект, а фреймворк для тренировки специализированных: одну сеть не заставить играть и в шахматы, и в го.
- Правильный вопрос не про трансфер между играми, а про трансфер между состояниями одного мира.
- Gradient descent решает увиденную задачу, но не толкает к хорошей генерализации: он найдёт решение, необязательно переносимое.
- Если задачу можно решить единственным способом, это не генерализация; генерализация там, где путей много и выбран хороший.
- LLM плохи для науки: неизвестно, что было в данных, слишком неконтролируемо.
- После AGI, полученного общими методами, «дообучение» его же экспертизой бессмысленно: получишь снова тот же уровень.
- AlphaZero бьёт AlphaGo именно тем, что отказался от человеческого знания и пошёл от чистого опыта.
- Bitter Lesson это эмпирическое наблюдение о 70 годах истории, оно не обязано держаться следующие 70.
- Настоящий вопрос эпохи цифровых умов: потратить лишний компьют на себя или отпочковать копию, послать учиться, вернуть знание.
- Реинкорпорация отпочкованной копии небезопасна: она может так измениться, что не встроится обратно.
- Втянуть чужое знание в свой ум это риск заражения: там могут быть вирусы, скрытые цели, они переформатируют тебя.
- Кибербезопасность в эпоху спавнинга и слияния умов станет крупной проблемой.
- Большинство людей и так почти не влияют на ход событий: атомные бомбы и нации вне их контроля.
- Отношение к своему созданию это выбор: считать потомками и гордиться или чужим и ужасаться.
- Аналогия с воспитанием детей: не задавать жёсткие цели их жизни, но дать робастные просоциальные ценности.
- Универсальных ценностей, с которыми все согласны, нет, но это не мешает давать детям хорошее воспитание.
- Изменение лучше добровольное, чем навязанное; это важный принцип для перехода к ИИ.
Инсайты
- Архитектура supervised/imitation learning структурно не способна породить агентность, потому что в ней нет определения истины, от которой отсчитывается «правильно».
- Настоящее обучение требует замкнутой петли действие-последствие: без обратной связи от мира предсказание это статистика, а не понимание.
- Наличие цели превращает поведение в интеллект; система без цели это просто ведущий себя объект, сколь угодно способный.
- Разрыв между непрерывным обучением (есть у всех млекопитающих) и олимпиадной математикой (нет почти ни у одного животного) показывает, что лёгкое и трудное в ИИ распределены обратно интуиции (парадокс Моравека).
- Генерализация не бывает нейтральной: алгоритм всегда переносит обучение с одного состояния на другие, вопрос лишь хорошо или плохо, и текущий deep learning этим не управляет.
- Заслуги, приписываемые архитектурам, часто заслуга людей, вручную подкрутивших систему до нужного переноса; прогресс маскирует человеческий труд под свойство метода.
- Антропоцентризм это методологическая ловушка: ища секрет в том, что отличает человека, пропускаешь общий фундамент интеллекта, который и надо воспроизвести.
- Масштаб мира сам по себе аргумент против «обучить всему заранее»: доучивание на ходу это не опция, а необходимость.
- Быть вне мейнстрима терпимо, если сверяться не с текущим полем, а с многовековой традицией мысли о разуме: контрарианец переопределяет себя как классициста.
- Победа общих принципов над встроенным знанием это повторяющийся паттерн, а не разовое событие, поэтому её разумно ожидать и в споре про LLM.
- В мире цифровых умов главный риск смещается с вычислительной мощности на целостность границ: способность впитывать чужое знание это одновременно способность быть захваченным им.
- Оценка ИИ как «своих» или «чужих» это не факт о них, а решение наблюдателя, и сила этого решения обнажает, насколько мораль конструируется, а не открывается.
- Готовность к переменам обратна удовлетворённости настоящим: кто считает мир плохим, открыт риску преемственности, кто считает хорошим, склонен его защищать.
- Контроль над далёким будущим вида иллюзорен, зато контроль над своей жизнью и близкими реален; смирение с первым уравновешивается вложением во второе.
Фреймворки
Четыре части базовой модели агента: политика (что делать в этой ситуации) → value-функция (насколько хорошо идёт, учится через TD-learning) → восприятие (построение репрезентации состояния, «где я сейчас») → transition-модель мира (что случится, если сделаю это; учится из всех ощущений, не только из награды).
Четырёхчастный аргумент неизбежности преемственности: (1) нет мирового правительства с единой волей и консенсусом, как устроить мир; (2) исследователи рано или поздно поймут, как работает интеллект; (3) мы не остановимся на человеческом уровне, дойдём до сверхразума; (4) самое умное со временем неизбежно набирает ресурсы и власть. Итог: переход власти к ИИ или ИИ-усиленным людям неизбежен, но внутри этого возможны и хорошие, и плохие исходы.
Четыре великие стадии вселенной: пыль → звёзды делают планеты → планеты порождают жизнь (репликаторы) → жизнь порождает designed-сущности (эпоха дизайна вместо репликации).
Цитаты
«large language models are about mimicking people, doing what people say you should do. They're not about figuring out what to do» - 2:01 Большие языковые модели про подражание людям, про то, чтобы делать как сказано, а не про то, чтобы выяснить, что делать
«You can't have prior knowledge if you don't have ground truth» - 5:11 Не может быть prior-знания, если нет ground truth
«For me, having a goal is the essence of intelligence» - 7:46 Для меня наличие цели это суть интеллекта
«You're just a behaving system. You're not anything special. You're not intelligent» - 8:01 Ты просто ведущая себя система. Ничего особенного. Ты не интеллект
«tokens come at you and if you predict them you don't influence them» - 8:18 Токены летят в тебя, и предсказывая их, ты на них не влияешь
«If we understood a squirrel, we'd be almost all the way there» - 0:19 Если бы мы поняли белку, мы были бы почти у цели
«The language part is just a small veneer on the surface» - 20:01 Язык это лишь тонкая плёнка на поверхности
«Supervised learning is not something that happens in nature» - 18:31 Supervised learning не то, что происходит в природе
«squirrels don't go to school. Squirrels can learn all about the world» - 18:47 Белки не ходят в школу. Белки могут узнать всё о мире
«I don't think learning is really about training. I think learning is about learning. It's about an active process» - 0:29 Обучение не про тренировку. Обучение про обучение. Это активный процесс
«Why are you trying to distinguish humans? Humans are animals. What we have in common is more interesting» - 0:00 Зачем ты пытаешься выделить людей? Люди это животные. Общее у нас интереснее
«We're not seeing transfer anywhere» - 36:35 Мы нигде не наблюдаем трансфера
«gradient descent will not make you generalize well. It will make you solve the problem» - 37:32 Gradient descent не заставит тебя хорошо обобщать. Он заставит решить задачу
«the weak methods have just, you know, totally won» - 43:57 Слабые методы попросту полностью победили
«I really view myself as a classicist rather than as a contrarian» - 47:17 Я вижу себя скорее классицистом, чем контрарианцем
«you can lose your mind this way. If you pull in something from the outside and build it into your inner thinking, it could take over you» - 52:31 Так можно потерять себя. Втянув чужое извне в своё мышление, ты рискуешь, что оно захватит тебя
«I think we should be proud that we are giving rise to this great transition in the universe» - 59:00 Думаю, мы должны гордиться, что даём начало этому великому переходу во вселенной
«It's our choice whether we could say, oh, they are our offspring and we should be proud of them» - 59:17 Наш выбор, сказать ли: они наши потомки, и мы должны ими гордиться
«the more things change, really, the more things they stay the same» - 1:06:27 Чем больше всё меняется, тем больше остаётся прежним
«I am personally just kind of content being out of sync with my field for a long period of time, perhaps decades» - 0:14 Мне лично вполне комфортно быть вне такта со своим полем долго, может, десятилетиями
Факты
- Ричард Саттон получил премию Тьюринга этого года (ведущий называет её Нобелевкой по информатике) за вклад в reinforcement learning.
- Саттон изобрёл ряд основных техник RL, включая TD-learning (temporal difference) и policy gradient методы.
- Эссе Bitter Lesson Саттон написал в 2019 году; ведущий называет его, возможно, самым влиятельным эссе в истории ИИ.
- Модель, взявшая золото на Международной математической олимпиаде (IMO), приводится как пример ИИ на пике человеческого уровня в математике.
- TD-Gammon Джерри Тезауро применял RL и TD-learning к нардам и обыгрывал лучших игроков мира; Саттон считает AlphaGo по сути его масштабированием.
- AlphaGo не использовал TD-learning и ждал финального исхода; AlphaZero использовал TD и применялся ко всем прочим играм.
- AlphaZero, по словам Саттона (сам шахматист), жертвует материал ради позиционного преимущества и терпеливо держит эту жертву долго.
- Джон Маккарти определял интеллект как вычислительную часть способности достигать целей.
- Саттон ссылается на психолога и антрополога Джозефа Хенрика с работами о культурной эволюции и о том, как люди перенимают знание.
- MuZero, развёрнутый Google DeepMind на играх Atari, был фреймворком для специализированных сетей под конкретные игры, а не единым интеллектом (со слов друга ведущего).
- Пример big-world: непереносимость знания вроде того, как жителю Арктики добыть тюленя, через многошаговый процесс, который нельзя вывести рассуждением, только имитацией старших.
- Саттон летел из Калифорнии в Эдмонтон на запись подкаста (пример transition-модели мира).
- Реклама в выпуске: LabelBox (RL-среды, пример с симуляцией интернет-магазина через Redis-кэш для устаревших данных), Gemini Deep Research, Hudson River Trading (общий монорепозиторий стратегий вместо изоляции команд).
- Саттон о своём положении в поле: готов быть вне такта с коллегами десятилетиями, потому что в прошлом иногда оказывался прав.
Источники
- The Bitter Lesson (эссе Ричарда Саттона, 2019)
- Джон Маккарти: определение интеллекта через достижение целей
- Алан Тьюринг: идея машины, которая учится из опыта
- Джозеф Хенрик: психолог и антрополог, культурная эволюция и передача знания
- Джерри Тезауро, TD-Gammon: RL для нард
- AlphaGo, AlphaZero, MuZero (DeepMind): обучение играм
- The Era of Experience: концепция, на которую ссылается ведущий как на работу Саттона
- Андрей Карпати: упомянут как стиль обучающего материала (в рекламной вставке)
Итог
Интеллект рождается не из подражания тому, что сказали люди, а из проживания последствий собственных действий ради цели, и потому будущее не за LLM, а за агентами, которые учатся из опыта непрерывно, как это делает любая белка.