Стэнфорд AA203 Оптимальное и обучаемое управление | Весна 2026 | Лекция 1: Обзор курса

Stanford Online11 августа 202614 95240510 мин чтениясегодня, 22:17

Коротко

Марко Павоне открывает Stanford AA203 «Optimal and Learning-Based Control»: механика курса (четыре ДЗ на 80% оценки, финал 8 июня на 20%, homework zero для самопроверки), а потом разворачивает всю карту предмета. Оптимальное управление отвечает на вопрос «как управлять системой наилучшим образом», а learning-based, что делать, когда модель системы неизвестна или меняется. Курс устроен как дерево: сначала известная модель (открытый контур, закрытый контур через динамическое программирование и HJB, MPC как мост между ними), потом данные вместо модели (имитационное обучение, model-based и model-free RL). Всё это, по словам Павоне, решает одну и ту же задачу с тремя ингредиентами: модель как ОДУ, ограничения, функционал качества. Ключевая линия лекции, различие open-loop («закрыл глаза и идёшь по плану») и closed-loop («держишь глаза открытыми, переоптимизируешься»), которое путают даже опытные исследователи.

Главный тезис

Оптимальное и обучающееся управление берёт классическую задачу управления и достраивает её тремя вещами, которых там нет: критерием качества (что значит «лучше»), планированием (откуда берётся опорный сигнал) и обучением (что делать без точной модели), а все методы курса при этом решают буквально одну и ту же оптимизационную задачу.

Ключевые идеи

  • 7:46 - управление это когда у системы (физической или финансовой) есть сенсор, опорный сигнал и контроллер, синтезирующий действие, а потом цикл повторяется по замкнутому контуру
  • 9:57 - классическое частотное управление (PID) уже умеет обеспечивать устойчивость, слежение, подавление возмущений и робастность к неточной модели
  • 14:07 - классике не хватает трёх вещей: производительности (есть ли лучший способ), планирования (откуда опорный сигнал) и обучения (что если модель неизвестна)
  • 16:08 - область родилась в Холодную войну ради траекторий баллистических ракет: Беллман в США, слепой математик Понтрягин в СССР, независимо и с общими чертами
  • 17:04 - open-loop вычисляет последовательность действий и исполняет вслепую (дёшево, но хрупко), closed-loop переоптимизируется по измерениям (мощно, но дорого)
  • 20:14 - MPC это мост: решаешь open-loop задачу, исполняешь первый кусок, замеряешь, пересчитываешь; после PID самый распространённый метод управления
  • 21:14 - во второй половине курса модель выводится из данных, а не задаётся: адаптивная, data-driven версия оптимального управления
  • 21:53 - три метода без модели: имитационное обучение (копируем демонстрацию эксперта), model-based и model-free RL (учимся методом проб и ошибок)
  • 22:16 - методы гибридизируются: в автономном вождении policy бутстрапят имитацией, потом дожимают RL, как SFT + RL в reasoning-моделях
  • 31:58 - для инженера управления ОДУ это не красивый объект, а механизм предсказания будущего через дискретизацию x(t+Δt) = x(t) + Δt·f
  • 35:56 - любое уравнение высокого порядка сводится к системе первого порядка добавлением переменных состояния (в двойном интеграторе добавляем скорость)
  • 41:52 - функционал качества = терминальная стоимость h(x(tf)) + интеграл стоимости g по траектории; аддитивная структура и даёт принцип оптимальности
  • 49:26 - оптимальное управление это бесконечномерная оптимизация: решение не два числа, а функция u(t), но инструменты переиспользуются из конечномерной теории
  • 26:39 - управленцы минимизируют cost J, состояние x, вход u; CS-сообщество максимизирует reward R, состояние s, действие a, те же вещи, разный жаргон
  • цель курса дать единый фреймворк и таксономию, чтобы дизайнер знал, когда какой инструмент брать, а не влюблялся в один метод

Почему это важно

Курс садится ровно на разлом момента в ИИ: хайп вокруг vision-language-action моделей продаёт идею, что обучение решает в робототехнике всё, а Павоне (профессор Стэнфорда и глава автономных систем в NVIDIA) утверждает обратное: в реальных роботах работают все методы сразу, гибридами. Выигрывает тот, кто держит в голове и классические прямые методы оптимального управления, и RL, и понимает, где кончается зона применимости каждого. Проигрывает инженер, влюбившийся в одну технику и тащащий её на любую задачу. За фигурами стоят два полюса истории дисциплины, Беллман и Понтрягин, США и СССР, а весь этот арсенал сегодня перепаковывается под автономное вождение и reasoning-модели для автономии.

Идеи

  • Управление это не только про дроны и самолёты, финансовый рынок тоже система, которую можно стабилизировать через контроллер
  • Человек делает closed-loop control с рождения: глаза, сенсоры, суставы, актуаторы, «дойти до двери», опорный сигнал
  • Модель системы можно не строить честно: для душа модель это «повернул кран вправо, теплее, влево, холоднее», и этого достаточно
  • Управленцы прагматичнее гидродинамиков: вместо термодинамической модели переноса тепла берут грубое упрощение или вовсе обходятся без модели
  • Open-loop не обязательно глупость: для траектории космического аппарата к Луне вычислить последовательность и исполнить её вслепую может быть нормально
  • Даже открытый контур на практике исполняют по receding horizon: проехал 10%, открыл глаза, пересчитал; так рождается MPC
  • Метафора всей лекции: «планирую шаги, закрываю глаза, надеюсь на лучшее» - если сосед встанет, врежусь в него
  • Понтрягин был слепым, деталь, которую Павоне отдельно отмечает про советского пионера
  • «Мой прагматичный взгляд на ОДУ», переопределение абстрактного объекта через его инженерный смысл предсказания
  • Все методы курса на одном слайде («crowded slide») - это агенда на весь квартал, и все они решают одну задачу
  • Ограничения в классическом feedback-контроле обычно не обсуждают явно, а в оптимальном они критичны: не врезаться в машину это constraint
  • Финальное время tf может быть не задано, а само быть предметом оптимизации: так кодируется «сделать как можно быстрее»
  • Быстро и экономно по топливу, конфликтующие цели: хочешь быстрее, жги больше горючего
  • Однажды работал в JPL над посадкой аппарата в конкретную точку Марса (кратер Гейла), это терминальный constraint из жизни
  • Возмущения можно моделировать по-разному: стохастически (случайно) или теоретико-игрово (природа как злонамеренный противник в худшем случае)
  • Задача «homicidal chauffeur»: пешеход всенаправлен, машина быстрее, но не может ехать по диагонали, на эксплуатации динамики строится спасение
  • Задача «lady in the lake»: пловчиха уходит от чудовища к берегу, ещё один худший-случай пример
  • Homework zero не оценивается и существует только чтобы студент сам понял, готов ли он к курсу
  • Прямой запрет на ChatGPT для homework zero: он решит задачи, но смысл теста для себя пропадёт
  • Курс намеренно жертвует глубиной ради широты: обзор всех главных техник за один семестр, глубина, самостоятельно
  • Обозначение open-loop через букву E, авторская педантичность Павоне, не стандарт; стандарт для policy это π
  • Разницу open/closed путают даже senior-исследователи, Павоне подаёт это как нюанс с большими последствиями
  • Максимизацию всегда можно переписать как минимизацию со знаком минус, тривиально, но соединяет два жаргона
  • Необходимые условия оптимальности работают как фильтр кандидатов: собрал точки, где градиент ноль, перебрал, взял минимальную
  • Late days (шесть штук, максимум два на задание), приглашение к стратегии, а не просто послабление

Инсайты

  • Прагматизм моделирования это осознанный выбор точности под решаемость: модель нужна ровно настолько точная, насколько позволяет синтезировать управление за разумное время
  • Аддитивная структура критерия качества не эстетика, а вычислительный фундамент: интеграл/сумма позволяет «нарезать» задачу и применить принцип оптимальности, а любая неаддитивность обрушивает всю вычислимость
  • Хрупкость open-loop и дороговизна closed-loop, фундаментальный размен между вычислительной эффективностью и робастностью, а MPC покупает робастность ценой повторного пересчёта
  • Один и тот же математический объект читается по-разному в зависимости от цели наблюдателя: ОДУ для математика, красота, для инженера, машина предсказания
  • Инженерная универсальность достигается редукцией к канонической форме: свести любую систему к первому порядку, потом применять один аппарат
  • Разные научные сообщества строят разный жаргон вокруг изоморфных концепций, и опасность не в математике, а в том, что термины «спотыкают» переходящего между полями
  • Переход от конечномерной к бесконечномерной оптимизации, расширение мышления, при котором старые инструменты не выбрасываются, а переносятся
  • Зрелость в инструментах это отказ от привязанности к одному: гибрид методов норма, монометодизм ошибка проектировщика
  • Худший-случай через теорию игр, способ получить робастность, моделируя природу как активного противника, а не пассивный шум
  • Педагогический метод Павоне: сначала объявить объект «cryptic», потом за три минуты показать его интуитивность, управление ожиданием как приём
  • Хайп вокруг одной парадигмы (VLA-модели «решают всё») опровергается практикой, где реальные системы всегда гибридны

Фреймворки

Три ингредиента любой задачи оптимального управления - все методы курса решают одну задачу с этими тремя компонентами:

  1. Математическая модель системы (набор ОДУ первого порядка)
  2. Ограничения (начальные/конечные условия, запретные зоны состояния, границы управления)
  3. Критерий качества (функционал J = терминальная стоимость + интеграл стоимости)

Дерево методов курса:

  • Модель известна → open-loop (indirect + direct методы) | closed-loop (dynamic programming, HJB/HJI) | MPC как мост
  • Модель неизвестна (data-driven) → imitation learning | RL model-based | RL model-free

Open-loop vs closed-loop: open-loop оптимизирует u как функцию только времени и начального условия; closed-loop оптимизирует политику π как функцию текущего состояния, надмножество, покрывающее и off-nominal сценарии.

Цитаты

«when I see an ODE, I see a mechanism to predict the future» - 32:00 Когда я вижу ОДУ, я вижу механизм предсказания будущего

«I plan my trajectory, I close my eyes, and then I hope for the best» - 17:40 Я планирую траекторию, закрываю глаза и надеюсь на лучшее

«if he stands up, and I have my eyes closed, I'm crashing to him» - 17:48 Если он встанет, а у меня закрыты глаза, я в него врежусь

«Is that the best of both words? Yes, that is called MPC» - 20:12 Это лучшее из обоих миров? Да, это называется MPC

«you shouldn't view each concept in competition with each other» - 23:10 Не стоит смотреть на эти концепции как на конкурентов

«This is by the hype that vision-like junction models are solving everything» - 24:12 Вопреки хайпу, что vision-language-action модели решают всё

«don't get in love too much with a given tool» - 25:09 Не влюбляйтесь слишком сильно в один инструмент

«If you make it too complicated, then if you can't solve it in a reasonable amount of time, then it's useless» - 41:36 Если усложнить задачу так, что не решишь её за разумное время, она бесполезна

«So through this class, you expand your mindset. Go from finite dimensions to infinite dimensions» - 49:56 Этот курс расширяет мышление: от конечных размерностей к бесконечным

«Don't use ChatGPT. Most likely they're solvable by ChatGPT. Use it as a standalone test for yourselves» - 4:47 Не используйте ChatGPT. Скорее всего он их решит. Используйте это как тест для себя

«this seems to be a fairly nuanced difference, but extremely important, and people get tripped over and over» - 55:31 Разница кажется тонкой, но крайне важна, и на ней спотыкаются снова и снова

«if you want to do something very fast, you have to spend more fuel» - 26:18 Хочешь сделать что-то очень быстро, придётся сжечь больше топлива

«by stability, we say we mean that the system doesn't go out of whack» - 12:30 Под устойчивостью мы понимаем, что система не идёт вразнос

Факты

  • Инструктор - Marco Pavone, профессор кафедры Aeronautics and Astronautics в Стэнфорде, с назначениями в Computer Science и Electrical Engineering, руководит Autonomous Systems Lab
  • Павоне параллельно возглавляет исследования автономных систем в NVIDIA
  • Курс - AA203, Optimal and Learning-Based Control, Stanford, Spring 2026
  • Оценка: 4 оценочных ДЗ = 80% (по 20% каждое), финал = 20%, плюс до 5% бонуса за участие
  • Финальный экзамен: 8 июня, с 15:30 до 18:30
  • Late days: шесть штук (в транскрипте оговорка), максимум два на одно задание
  • Ресешны первые четыре недели по пятницам 13:30-14:30, темы, JAX, регрессионные модели
  • Оптимальное управление как область, примерно 50 лет, старт в Холодную войну ради траекторий баллистических ракет
  • Пионеры: Richard Bellman (США, уравнение Беллмана) и Понтрягин (СССР, слепой математик)
  • До Стэнфорда Павоне работал в JPL, занимался посадкой аппарата в конкретную точку Марса (кратер Гейла, «just to make it up», пример)
  • После PID, по утверждению Павоне, MPC самый распространённый метод управления
  • Пример системы, двойной интегратор: тележка на горизонтали, одна переменная состояния (смещение), масса принята за единицу, управление, ускорение
  • Пререквизиты: многомерный анализ, ОДУ, сильная линейная алгебра; желательны (не обязательны) оптимизация, ML, теория управления
  • Homework zero уже выложено на сайт, не оценивается, решения будут предоставлены
  • Первые ~2-3 недели, open-loop, ~3 недели closed-loop (DP + HJB), 2-3 лекции MPC, затем data-driven часть

Источники

  • Richard Bellman - уравнение Беллмана, динамическое программирование
  • Понтрягин - советская школа оптимального управления
  • JAX - инструмент для ресешнов
  • Engineering 105 / ENGR 105 - стэнфордский курс классического управления (референс)
  • Задачи-классика оптимального управления: homicidal chauffeur, lady in the lake
  • Course notes и список книг, на сайте курса (в силлабусе)

Итог

Оптимальное и обучающееся управление это классическое управление плюс три недостающих вопроса: что значит «лучше», откуда берётся цель и что делать без модели. Вся сила курса в том, чтобы видеть за пёстрым зоопарком методов одну задачу и не влюбляться ни в один инструмент.

readmint Pro

То, что вы только что прочитали —это саммари readmint

Оформите доступ — и получайте такой же разбор по любому своему видео. Вставляете ссылку, через 2–3 минуты готов пересказ с главными тезисами и цитатами. Без воды и без перемотки.

  • Безлимит саммари — сколько угодно видео
  • Главные тезисы и цитаты без воды
  • Приоритет в очереди обработки
  • Без рекламы и сторонних блоков
Получить такое же саммари
Доступ откроется сразу после оплаты — вставите ссылку и начнёте.

Или 4 900 ₽/год — доступ откроется сразу после оплаты.

Ещё с канала «Stanford Online»

Все видео