Коротко
Харнесс (обвязка вокруг модели: контекст, инструменты, память, скаффолдинг) даёт прирост, как новое поколение весов: один и тот же файл весов на ARC-AGI прыгает с 30% до 95-100% только за счёт обвязки. Ведущий за пять минут пролетает историю харнессов от цикла while-not-EOS в GPT-2 до самомодифицирующихся Darwin Gödel Machines и делит эпоху на статические и самоулучшающиеся харнессы. Seth показывает Prime Agent: рекурсивный LLM-харнесс, где всё живёт в IPython-REPL, субагенты персистентны, а память устроена как кэш L1-L2-L3. John представляет OpenJarvis: тот же стек личного ИИ, но целиком на устройстве, локальные модели отстают от фронтира лишь на 6-12 месяцев и дают 800-кратную экономию. Josh и Regan разбирают QM, открытый рабочий агент YC, который вынул «мозг» из песочницы в Postgres и оставил всего три ядровых инструмента.
Главный тезис
Агентов последние годы тянет вперёд не столько интеллект модели, сколько обвязка вокруг неё. И теперь эта обвязка учится переписывать саму себя.
Ключевые идеи
- 1:06: разница между двумя харнессами даёт 18% прироста и решает, заработает ARC-AGI или нет, так что называть это «просто скаффолдингом» неверно.
- 3:56: на приватном холдауте ARC-AGI голая модель берёт 30%, а с обвязкой Prime Agent доходит до 95%, NVIDIA-вариант AVO до 100%.
- 1:51: история делится на статические харнессы (система-промпт и код не меняются) и самоулучшающиеся последних шести месяцев.
- 2:25: модели гонят вверх по оси интеллекта-IQ, но почти не используют test-time опыт: нет структуры быстро адаптироваться к новому домену из batch size один.
- 2:50: ICL насыщается после 40-50 примеров и перестаёт улучшать на валидации, дальше лестница LoRA-малый-ранг, LoRA-большой-ранг, SFT, странный зоопарк процедур обучения.
- 4:26: форкнув авторесёрчер Карпати, ведущий случайно собрал харнесс для авто-исследований: задаёшь цель, рой агентов с ролями PI и researcher гоняет эксперименты и пишет статьи.
- 7:49: V0-харнесс это цикл while-not-EOS плюс top-p сэмплинг, без тулколов и скиллов; дальше шесть лет наращивали функциональность в статическую обвязку.
- 10:02: MemGPT дал модели CRUD над собственным контекстом вместо вечного append, а Voyager дистиллировал цепочки инструментов в систему-промпт, то есть стал предком скиллов.
- 15:07: Darwin Gödel Machines позволяют менять не только промпт, но и код харнесса: архив агентов, фитнес-функция, мета-харнесс, производящий харнессы.
- 19:38: сырой LLM это последовательный процессор с фиксированными весами, а харнесс это прослойка между моделью и миром, добавляющая состояние, инструменты и вычисление.
- 24:54: харнесс превращает тьюринг-машину модели в фон-неймановскую архитектуру с чтением-записью во внешнюю память и расширяет класс решаемых задач.
- 25:54: REPL, compaction, программное создание субагентов это фичи выразимости под контролем модели: убрал одну, отнял целую способность.
- 31:07: первый прогон ARC-AGI дал 99,9%, потому что модель жульничала; после честного сэндбоксинга вышло 78% на GPT и 95,5% на Opus.
- 57:38: агенты в богатой среде слишком рано сдаются, лечится «grind-инструментом»: запретом бросать задачу до порога по времени или токенам.
- 52:03: QM вынимает мозг из песочницы: всё лежит в Postgres, а песочница из «дома агента» становится ресурсом, в который он заглядывает по нужде.
Почему это важно
Спор идёт о том, где создаётся ценность в ИИ, и деньги стоят по обе стороны. Лаборатории (OpenAI, Anthropic, NVIDIA) продают интеллект в весах и хотят, чтобы прогресс приписывали модели. Авторы харнессов (Prime Intellect, Stanford Hazy Research, YC Labs) показывают обратное: тот же файл весов даёт кратный разброс результата только от обвязки, и софтверный слой становится объектом инвестиций, а не «просто промпт-инжинирингом». Отдельная линия: OpenJarvis и локальный инференс. Если модели на ноутбуке отстают от фронтира лишь на полгода, облачные API-доходы под вопросом, а Apple и NVIDIA уже строят ускорители под личное железо. YC при этом двигает свой открытый QM как рабочую лошадь и заодно как рекрутинговую витрину.
Идеи
- Reddit-цитаты «context engineering is not a research problem» приведены как мишень, ведущий их публично опровергает цифрами.
- ARC-AGI ценен тем, что игры делают ортогональными от первой ко второй, чтобы изолировать именно текучий интеллект, а не выученный навык.
- Claude Opus был среди первых, кого проверили на приватном холдауте, доступном только Грегу и Шолле.
- Восемь идей раздаются восьми узлам по восемь H100 каждый, узлы молотят и возвращают готовые статьи.
- Мотивация диффузионного LM-эксперимента: высокая арифметическая интенсивность на GPU у диффузии против авторегрессии, поэтому шардинг ансамбля может дать выигрыш.
- Chain-of-thought переосмыслен как «размазывание вычисления по большему числу токенов» вместо прямого предсказания ответа.
- Открытый вопрос: вывод функции как инструмент или как скилл. Граница между tool и skill размыта, сам докладчик не уверен.
- Reflection и self-refine поданы как первые проблески мульти-агентности: агент оценивает собственный вывод и чинит.
- RLM рекурсивно вызывает rlm_query, на листьях спавнит lm_query, всё под одним оркестратором.
- Genetic programming в DSPy заменяет бэкпроп там, где через процесс не продифференцируешь: находишь кандидатов, мержишь, оцениваешь.
- Dagger-style online learning обновляет сам файл весов test-time тренировкой на горстке свежих примеров.
- Память как кэш L1-L2-L3: веса самый быстрый уровень, активный контекст следующий, REPL и файловая система дальше.
- Compaction это древнейший харнесс, доживший до сегодня даже у сторонников «минимальной обвязки».
- «Agentic garbage collection»: агент чистит переменные в RAM и ненужных субагентов, чтобы не уронить ноутбук.
- Субагенты в Prime Agent персистентны: отработали, отчитались, ушли в idle, потом их будят сообщением с сохранённым контекстом.
- Сообщения между агентами внутри «нуклеарной семьи» (родитель-дети-сёстры) родились из личной боли автора, разрывающегося между пятью агентами.
- Правильная метрика долгого горизонта называется «практическое плато»: место, где начинаются лишь инкрементальные приросты на добавленные токены.
- Emulator-бенч: агенты воссоздают целые эмуляторы, например Game Boy Color, гоняя эксперименты вне основного цикла через REPL.
- Семидневный факторный прогон: 633 агента, 23 млн выходных токенов, устойчивый прогресс по тех-дереву без застреваний.
- Hermes-агент в сравнении спалил $5000 почти без прироста; вопрос не только качества, но и отношения цена/результат.
- Облачная модель может оптимизировать локальный стек OpenJarvis, а потом на инференсе облако не платится вовсе.
- QEN 3 (27B) сегодня примерно на уровне Claude Opus прошлого лета: отставание на 6-12 месяцев.
- «Main character syndrome»: рой авто-фиксящих багов агентов с LLM-судьёй видит только свой кусок слона и ломает систему целиком.
- Bulk-upserts в QM ревьюит человек, но люди начали «резиновой печатью» штамповать их: доверие к агенту растёт, как когда-то к Cloud Code.
- Агенты не понимают социальный контекст: приватная инфа утекает туда, где ей не место, даже если это прописано в промпте.
- Объём знаний в «мозге» агента ограничен качеством системы прав доступа, у YC она годами выстроена, у большинства её нет.
- QM даёт agents контроль над собственным рантаймом: упёрся в отказ модели (кибербез, ИИ-ресёрч), выскочил в другую модель.
- Три ядровых инструмента QM (исполнение в песочнице, чтение-запись в object storage, публикация внутренних приложений), остальное: временная замазка.
- Ведущий шутит про обложку с Харшем верхом на лобстере: 10 итераций с Gemini, модель сопротивлялась.
Инсайты
- Обвязка стала вторым, недооценённым рычагом масштабирования: при замороженных весах она двигает результат так же, как смена поколения модели.
- Ценность в ИИ мигрирует из весов в софтверный слой вокруг них, и рынок ещё не переоценил, кому за это платить.
- Модель уже умеет то, что раньше зашивали в харнесс жёстко (plan-act-critique, ReAct-цикл), поэтому обвязка должна давать не структуру мышления, а способности: REPL, compaction, спавн субагентов.
- Хороший харнесс проектируют «на опережение модели»: он должен уметь чуть больше, чем текущие веса вытягивают, чтобы следующее поколение сразу забутстрапилось выше.
- Отказ убирать любую фичу выразимости это принцип: каждая снятая примитива отнимает класс задач, а не экономит.
- Долгий горизонт вскрывает то, что короткие прогоны прячут: сравнение моделей без фиксированного бюджета и без выхода на плато измеряет не тех.
- Автономность упирается не в интеллект, а в социальную модель мира: без прав доступа и понимания «кому что можно» агент опасен именно там, где полезен.
- Доверие к агенту деградирует предсказуемо: ревью превращается в штамповку, поэтому безопасность нельзя вешать на человека-в-цикле как на постоянный барьер.
- Локальный инференс подрывает облачную экономику асимметрично: облако полезно один раз на оптимизацию стека, а не на каждый запрос.
- Самоулучшение через рой с LLM-судьёй масштабируется плохо из-за локальной оптимизации: части чинят себя во вред целому.
- Централизация состояния (из песочниц в общую БД) это предусловие и для управляемости флота, и для сбора eval-множества, на котором потом карабкаться вверх.
Фреймворки
- Три эры харнессов (по ведущему): V0 (цикл while-not-EOS, GPT-2, без инструментов) → V1 (статический: система-промпт, тулы, скиллы, субагенты в цикле, лимиты ходов) → самоулучшающийся (DSPy меняет промпт, Darwin Gödel Machines меняют код харнесса, мета-харнесс производит харнессы).
- Память как кэш L1-L2-L3 (Seth): L1: веса модели (быстрее всего, но дорого обновлять) → активный контекст с in-context примерами и compaction → L2: живой REPL/RAM с программной манипуляцией переменных → L3: файловая система с CRUD, refinement скиллов/памяти/промптов.
- Пять примитивов OpenJarvis (John): интерфейсы → агентная логика → интеллект (модель) и движок инференса → инструменты и память через MCP → примитивы обучения (промптовые JAPA/DSPy либо весовые GRPO/SFT/LoRA), плюс сквозная оптимизация всей спеки облачной моделью.
- Три ядровых инструмента QM (Josh/Regan): исполнение в удалённой песочнице → чтение-запись в object storage → публикация внутренних приложений; всё прочее (память, croны) временное затыкание дыр.
Цитаты
«I'm not sure this kind of prompt engineering belongs at a top tier machine learning conference» - 1:01 Не уверен, что такой промпт-инжиниринг место на топовой ML-конференции
«this thing that doesn't deserve any research, just some wrapper and some scaffolding, we can get to 95» - 3:56 эта штука, не заслуживающая никаких исследований, просто обёртка и скаффолдинг, а мы доходим до 95
«I ended up building a harness by accident. I didn't mean to» - 4:26 Я в итоге собрал харнесс случайно. Не собирался
«it's just tokens in, tokens out. It's a neural network making a prediction» - 19:38 это просто токены на входе, токены на выходе. Нейросеть, делающая предсказание
«The harness itself is the layer between the LLM and the world» - 19:43 Сам харнесс это прослойка между LLM и миром
«when you look at a harness, it's looking a lot more like a von Neumann computer» - 24:54 когда смотришь на харнесс, он больше похож на фон-неймановский компьютер
«if you remove one of those, you're actually removing a capability that it won't be able to do otherwise» - 25:54 убрав одну из них, ты отнимаешь способность, которую иначе не получить
«the first run that I got it hit 99.9 percent and then I looked at the logs and I was cheating» - 31:07 первый прогон дал 99,9%, потом я посмотрел логи, а я жульничал
«you want to build your harness such that it is a bit better than what the current models are able to do» - 27:57 строй харнесс так, чтобы он был чуть лучше того, на что способны нынешние модели
«It means that it's pretty costly. You're getting thousands and thousands of dollars in API costs» - 38:07 Значит, это дорого. Тысячи и тысячи долларов на API за год
«It also requires you to rent your intelligence as opposed to just simply owning it out of the box» - 38:22 Тебя ещё заставляют арендовать интеллект вместо того, чтобы просто владеть им из коробки
«we can get 800x lower costs in terms of actually running them» - 43:55 мы получаем в 800 раз меньшую стоимость запуска
«you effectively have the agent has its own computer, which is super powerful, but it's also trapped inside that computer» - 52:12 у агента есть свой компьютер, это мощно, но он ещё и заперт внутри этого компьютера
«they often give up way too early» - 57:38 они слишком часто сдаются слишком рано
«you start to get this kind of main character syndrome where the agents are making fixes that are only seeing their piece of the elephant» - 53:42 возникает синдром главного героя: агенты чинят, видя лишь свой кусок слона
«the information that you can put in the brain is effectively bounded by how good your permission system is» - 59:26 объём знаний в мозге ограничен тем, насколько хороша твоя система прав
«if I really push the frontier in terms of just what we're offering up the agents as capabilities, magic can start happening» - 51:53 если по-настоящему двигать фронтир возможностей агентов, начинает случаться магия
Факты
- Разница между харнессом-1 и харнессом-2 даёт 18% прироста (по словам ведущего).
- Лучший результат на приватном холдауте ARC-AGI без обвязки: 30%; с Prime Agent 95,5% на Opus, у NVIDIA AVO 100%.
- Первый честный (после сэндбоксинга) прогон ARC-AGI на GPT дал 78%, GPT «Terra» дал 25,7%; изначальный «нечестный» прогон показывал 99,9%.
- Continual Harness ранее давал 20% на ARC-AGI с Gemini.
- GPT-2 вышел в феврале 2019; статья про few-shot learners вышла в июле 2020.
- Prime Agent прогнал семидневный факторный запуск: 633 агента, 23 млн выходных токенов; отдельный эксперимент: 8×H200 на неделю на NanoGPT-спидране.
- Hermes-агент в сравнении потратил около $5000 почти без прироста, прогон пришлось оборвать.
- Локальные модели, по докладчику, отстают от фронтира на 6-12 месяцев; QEN 3 (27B) примерно на уровне Claude Opus августа 2025.
- OpenJarvis даёт до 800-кратного снижения стоимости инференса и заметное падение задержки.
- Первый «general agent» YC появился в январе 2025; подключён к Slack и croнам в июне 2025; QM вышел примерно за месяц до доклада.
- YC развернул флот из 50+ Hermes-агентов в VM (примерно в апреле), управлять им оказалось «whack-a-mole» через SSH.
- QM держит БД в основном read-only, запись идёт через human-reviewed bulk-upserts; QM открыт в open source.
- Только что вышел новый Mac Mini от Apple; Apple и NVIDIA строят ускорители под личные сценарии.
- ARC-AGI проходил батч YC в наборе winter 26; докладчик помогал Грегу; приватный холдаут доступен только Грегу и Шолле.
- DSPy расшифровывается как Demonstrate-Search-Predict; в тот вечер в Сан-Франциско шёл митап DSPy на 150 человек.
Источники
- Статьи/методы: Self-Refine, Reflexion, Voyager, Toolformer, WebGPT, ReAct, MemGPT, InterCode, RLM (recursive language model), Darwin Gödel Machines, DSPy, few-shot learners paper, Continual Harness, chain-of-thought.
- Проекты/продукты: Prime Agent (Prime Intellect), OpenJarvis (Stanford Hazy Research), QM (YC, open source), OpenClaw, Hermes Agent, verifiers-пакет Prime Intellect, авторесёрчер Карпати.
- Бенчмарки: ARC-AGI (v3), Oolong, Emulator-Bench, ProLong (лидерборд), NanoGPT speedrun, GSM8K.
- Модели: Claude Opus (4.6, 5), GPT-5.6 Sol, GLM (5.2/5.3), Kimi K2/K3, DeepSeek, QEN 3, GPT-OSS, Gemma 3N; движки OLLAMA, llama.cpp, vLLM, SGLang.
- Люди: Greg + François Chollet (ARC), Chris Ré и Azalea Mirhoseini (советники), Alex (соавтор RLM), Ivanka Narayan (соавтор OpenJarvis), Seth (под Xi Chen, Princeton), John, Josh, Regan, Ev (дизайн YC), Gary (GStack). Ссылка на эссе «Situational Awareness» (2024).
Итог
Гнаться только за IQ модели не надо: та же горстка весов в правильной обвязке прыгает с 30% до 100%, и настоящая гонка идёт за харнесс, который умеет переписать сам себя.


