Коротко
Марко Павоне открывает Stanford AA203 «Optimal and Learning-Based Control»: механика курса (четыре ДЗ на 80% оценки, финал 8 июня на 20%, homework zero для самопроверки), а потом разворачивает всю карту предмета. Оптимальное управление отвечает на вопрос «как управлять системой наилучшим образом», а learning-based, что делать, когда модель системы неизвестна или меняется. Курс устроен как дерево: сначала известная модель (открытый контур, закрытый контур через динамическое программирование и HJB, MPC как мост между ними), потом данные вместо модели (имитационное обучение, model-based и model-free RL). Всё это, по словам Павоне, решает одну и ту же задачу с тремя ингредиентами: модель как ОДУ, ограничения, функционал качества. Ключевая линия лекции, различие open-loop («закрыл глаза и идёшь по плану») и closed-loop («держишь глаза открытыми, переоптимизируешься»), которое путают даже опытные исследователи.
Главный тезис
Оптимальное и обучающееся управление берёт классическую задачу управления и достраивает её тремя вещами, которых там нет: критерием качества (что значит «лучше»), планированием (откуда берётся опорный сигнал) и обучением (что делать без точной модели), а все методы курса при этом решают буквально одну и ту же оптимизационную задачу.
Ключевые идеи
- 7:46 - управление это когда у системы (физической или финансовой) есть сенсор, опорный сигнал и контроллер, синтезирующий действие, а потом цикл повторяется по замкнутому контуру
- 9:57 - классическое частотное управление (PID) уже умеет обеспечивать устойчивость, слежение, подавление возмущений и робастность к неточной модели
- 14:07 - классике не хватает трёх вещей: производительности (есть ли лучший способ), планирования (откуда опорный сигнал) и обучения (что если модель неизвестна)
- 16:08 - область родилась в Холодную войну ради траекторий баллистических ракет: Беллман в США, слепой математик Понтрягин в СССР, независимо и с общими чертами
- 17:04 - open-loop вычисляет последовательность действий и исполняет вслепую (дёшево, но хрупко), closed-loop переоптимизируется по измерениям (мощно, но дорого)
- 20:14 - MPC это мост: решаешь open-loop задачу, исполняешь первый кусок, замеряешь, пересчитываешь; после PID самый распространённый метод управления
- 21:14 - во второй половине курса модель выводится из данных, а не задаётся: адаптивная, data-driven версия оптимального управления
- 21:53 - три метода без модели: имитационное обучение (копируем демонстрацию эксперта), model-based и model-free RL (учимся методом проб и ошибок)
- 22:16 - методы гибридизируются: в автономном вождении policy бутстрапят имитацией, потом дожимают RL, как SFT + RL в reasoning-моделях
- 31:58 - для инженера управления ОДУ это не красивый объект, а механизм предсказания будущего через дискретизацию
x(t+Δt) = x(t) + Δt·f - 35:56 - любое уравнение высокого порядка сводится к системе первого порядка добавлением переменных состояния (в двойном интеграторе добавляем скорость)
- 41:52 - функционал качества = терминальная стоимость
h(x(tf))+ интеграл стоимостиgпо траектории; аддитивная структура и даёт принцип оптимальности - 49:26 - оптимальное управление это бесконечномерная оптимизация: решение не два числа, а функция
u(t), но инструменты переиспользуются из конечномерной теории - 26:39 - управленцы минимизируют cost
J, состояниеx, входu; CS-сообщество максимизирует rewardR, состояниеs, действиеa, те же вещи, разный жаргон - цель курса дать единый фреймворк и таксономию, чтобы дизайнер знал, когда какой инструмент брать, а не влюблялся в один метод
Почему это важно
Курс садится ровно на разлом момента в ИИ: хайп вокруг vision-language-action моделей продаёт идею, что обучение решает в робототехнике всё, а Павоне (профессор Стэнфорда и глава автономных систем в NVIDIA) утверждает обратное: в реальных роботах работают все методы сразу, гибридами. Выигрывает тот, кто держит в голове и классические прямые методы оптимального управления, и RL, и понимает, где кончается зона применимости каждого. Проигрывает инженер, влюбившийся в одну технику и тащащий её на любую задачу. За фигурами стоят два полюса истории дисциплины, Беллман и Понтрягин, США и СССР, а весь этот арсенал сегодня перепаковывается под автономное вождение и reasoning-модели для автономии.
Идеи
- Управление это не только про дроны и самолёты, финансовый рынок тоже система, которую можно стабилизировать через контроллер
- Человек делает closed-loop control с рождения: глаза, сенсоры, суставы, актуаторы, «дойти до двери», опорный сигнал
- Модель системы можно не строить честно: для душа модель это «повернул кран вправо, теплее, влево, холоднее», и этого достаточно
- Управленцы прагматичнее гидродинамиков: вместо термодинамической модели переноса тепла берут грубое упрощение или вовсе обходятся без модели
- Open-loop не обязательно глупость: для траектории космического аппарата к Луне вычислить последовательность и исполнить её вслепую может быть нормально
- Даже открытый контур на практике исполняют по receding horizon: проехал 10%, открыл глаза, пересчитал; так рождается MPC
- Метафора всей лекции: «планирую шаги, закрываю глаза, надеюсь на лучшее» - если сосед встанет, врежусь в него
- Понтрягин был слепым, деталь, которую Павоне отдельно отмечает про советского пионера
- «Мой прагматичный взгляд на ОДУ», переопределение абстрактного объекта через его инженерный смысл предсказания
- Все методы курса на одном слайде («crowded slide») - это агенда на весь квартал, и все они решают одну задачу
- Ограничения в классическом feedback-контроле обычно не обсуждают явно, а в оптимальном они критичны: не врезаться в машину это constraint
- Финальное время
tfможет быть не задано, а само быть предметом оптимизации: так кодируется «сделать как можно быстрее» - Быстро и экономно по топливу, конфликтующие цели: хочешь быстрее, жги больше горючего
- Однажды работал в JPL над посадкой аппарата в конкретную точку Марса (кратер Гейла), это терминальный constraint из жизни
- Возмущения можно моделировать по-разному: стохастически (случайно) или теоретико-игрово (природа как злонамеренный противник в худшем случае)
- Задача «homicidal chauffeur»: пешеход всенаправлен, машина быстрее, но не может ехать по диагонали, на эксплуатации динамики строится спасение
- Задача «lady in the lake»: пловчиха уходит от чудовища к берегу, ещё один худший-случай пример
- Homework zero не оценивается и существует только чтобы студент сам понял, готов ли он к курсу
- Прямой запрет на ChatGPT для homework zero: он решит задачи, но смысл теста для себя пропадёт
- Курс намеренно жертвует глубиной ради широты: обзор всех главных техник за один семестр, глубина, самостоятельно
- Обозначение open-loop через букву E, авторская педантичность Павоне, не стандарт; стандарт для policy это π
- Разницу open/closed путают даже senior-исследователи, Павоне подаёт это как нюанс с большими последствиями
- Максимизацию всегда можно переписать как минимизацию со знаком минус, тривиально, но соединяет два жаргона
- Необходимые условия оптимальности работают как фильтр кандидатов: собрал точки, где градиент ноль, перебрал, взял минимальную
- Late days (шесть штук, максимум два на задание), приглашение к стратегии, а не просто послабление
Инсайты
- Прагматизм моделирования это осознанный выбор точности под решаемость: модель нужна ровно настолько точная, насколько позволяет синтезировать управление за разумное время
- Аддитивная структура критерия качества не эстетика, а вычислительный фундамент: интеграл/сумма позволяет «нарезать» задачу и применить принцип оптимальности, а любая неаддитивность обрушивает всю вычислимость
- Хрупкость open-loop и дороговизна closed-loop, фундаментальный размен между вычислительной эффективностью и робастностью, а MPC покупает робастность ценой повторного пересчёта
- Один и тот же математический объект читается по-разному в зависимости от цели наблюдателя: ОДУ для математика, красота, для инженера, машина предсказания
- Инженерная универсальность достигается редукцией к канонической форме: свести любую систему к первому порядку, потом применять один аппарат
- Разные научные сообщества строят разный жаргон вокруг изоморфных концепций, и опасность не в математике, а в том, что термины «спотыкают» переходящего между полями
- Переход от конечномерной к бесконечномерной оптимизации, расширение мышления, при котором старые инструменты не выбрасываются, а переносятся
- Зрелость в инструментах это отказ от привязанности к одному: гибрид методов норма, монометодизм ошибка проектировщика
- Худший-случай через теорию игр, способ получить робастность, моделируя природу как активного противника, а не пассивный шум
- Педагогический метод Павоне: сначала объявить объект «cryptic», потом за три минуты показать его интуитивность, управление ожиданием как приём
- Хайп вокруг одной парадигмы (VLA-модели «решают всё») опровергается практикой, где реальные системы всегда гибридны
Фреймворки
Три ингредиента любой задачи оптимального управления - все методы курса решают одну задачу с этими тремя компонентами:
- Математическая модель системы (набор ОДУ первого порядка)
- Ограничения (начальные/конечные условия, запретные зоны состояния, границы управления)
- Критерий качества (функционал
J= терминальная стоимость + интеграл стоимости)
Дерево методов курса:
- Модель известна → open-loop (indirect + direct методы) | closed-loop (dynamic programming, HJB/HJI) | MPC как мост
- Модель неизвестна (data-driven) → imitation learning | RL model-based | RL model-free
Open-loop vs closed-loop: open-loop оптимизирует u как функцию только времени и начального условия; closed-loop оптимизирует политику π как функцию текущего состояния, надмножество, покрывающее и off-nominal сценарии.
Цитаты
«when I see an ODE, I see a mechanism to predict the future» - 32:00 Когда я вижу ОДУ, я вижу механизм предсказания будущего
«I plan my trajectory, I close my eyes, and then I hope for the best» - 17:40 Я планирую траекторию, закрываю глаза и надеюсь на лучшее
«if he stands up, and I have my eyes closed, I'm crashing to him» - 17:48 Если он встанет, а у меня закрыты глаза, я в него врежусь
«Is that the best of both words? Yes, that is called MPC» - 20:12 Это лучшее из обоих миров? Да, это называется MPC
«you shouldn't view each concept in competition with each other» - 23:10 Не стоит смотреть на эти концепции как на конкурентов
«This is by the hype that vision-like junction models are solving everything» - 24:12 Вопреки хайпу, что vision-language-action модели решают всё
«don't get in love too much with a given tool» - 25:09 Не влюбляйтесь слишком сильно в один инструмент
«If you make it too complicated, then if you can't solve it in a reasonable amount of time, then it's useless» - 41:36 Если усложнить задачу так, что не решишь её за разумное время, она бесполезна
«So through this class, you expand your mindset. Go from finite dimensions to infinite dimensions» - 49:56 Этот курс расширяет мышление: от конечных размерностей к бесконечным
«Don't use ChatGPT. Most likely they're solvable by ChatGPT. Use it as a standalone test for yourselves» - 4:47 Не используйте ChatGPT. Скорее всего он их решит. Используйте это как тест для себя
«this seems to be a fairly nuanced difference, but extremely important, and people get tripped over and over» - 55:31 Разница кажется тонкой, но крайне важна, и на ней спотыкаются снова и снова
«if you want to do something very fast, you have to spend more fuel» - 26:18 Хочешь сделать что-то очень быстро, придётся сжечь больше топлива
«by stability, we say we mean that the system doesn't go out of whack» - 12:30 Под устойчивостью мы понимаем, что система не идёт вразнос
Факты
- Инструктор - Marco Pavone, профессор кафедры Aeronautics and Astronautics в Стэнфорде, с назначениями в Computer Science и Electrical Engineering, руководит Autonomous Systems Lab
- Павоне параллельно возглавляет исследования автономных систем в NVIDIA
- Курс - AA203, Optimal and Learning-Based Control, Stanford, Spring 2026
- Оценка: 4 оценочных ДЗ = 80% (по 20% каждое), финал = 20%, плюс до 5% бонуса за участие
- Финальный экзамен: 8 июня, с 15:30 до 18:30
- Late days: шесть штук (в транскрипте оговорка), максимум два на одно задание
- Ресешны первые четыре недели по пятницам 13:30-14:30, темы, JAX, регрессионные модели
- Оптимальное управление как область, примерно 50 лет, старт в Холодную войну ради траекторий баллистических ракет
- Пионеры: Richard Bellman (США, уравнение Беллмана) и Понтрягин (СССР, слепой математик)
- До Стэнфорда Павоне работал в JPL, занимался посадкой аппарата в конкретную точку Марса (кратер Гейла, «just to make it up», пример)
- После PID, по утверждению Павоне, MPC самый распространённый метод управления
- Пример системы, двойной интегратор: тележка на горизонтали, одна переменная состояния (смещение), масса принята за единицу, управление, ускорение
- Пререквизиты: многомерный анализ, ОДУ, сильная линейная алгебра; желательны (не обязательны) оптимизация, ML, теория управления
- Homework zero уже выложено на сайт, не оценивается, решения будут предоставлены
- Первые ~2-3 недели, open-loop, ~3 недели closed-loop (DP + HJB), 2-3 лекции MPC, затем data-driven часть
Источники
- Richard Bellman - уравнение Беллмана, динамическое программирование
- Понтрягин - советская школа оптимального управления
- JAX - инструмент для ресешнов
- Engineering 105 / ENGR 105 - стэнфордский курс классического управления (референс)
- Задачи-классика оптимального управления: homicidal chauffeur, lady in the lake
- Course notes и список книг, на сайте курса (в силлабусе)
Итог
Оптимальное и обучающееся управление это классическое управление плюс три недостающих вопроса: что значит «лучше», откуда берётся цель и что делать без модели. Вся сила курса в том, чтобы видеть за пёстрым зоопарком методов одну задачу и не влюбляться ни в один инструмент.


