Коротко
Инженеры Ramp встроили Claude-агентов во весь цикл разработки: от генерации идей и поиска багов до код-ревью и наблюдения за фичей в проде после деплоя. Ключевая ставка команды: строить не под текущую модель, а под ту, что выйдет через три-шесть месяцев, потому что скаффолдинг вокруг модели устаревает быстрее, чем окупается. Главный инструмент это dynamic workflows, новая форма test-time compute, где Claude оркестрирует десятки суб-агентов с состязательной верификацией, плюс loops/routines для повторяющейся рутины вроде фикса CI и ребейза PR. Один такой воркфлоу срезал время CI с 18 минут P50 до 6, профилируя систему днями подряд и планируя себе перезапуск ради свежих продовых данных. Доступ к моделям неограниченный по токенам, но обвязан жёсткими контролями: read-only ключи, network policies и принцип наименьших привилегий, всё это построено самой командой безопасности.
Главный тезис
Не оптимизируй под сегодняшнюю модель: дай агенту роль коллеги, максимум контекста и доступа под жёсткими гардрейлами. Строй харнес под интеллект, который придёт через несколько месяцев, потому что скорость роста моделей важнее их текущего снимка.
Ключевые идеи
- 0:34 Первый заход с новой моделью выбор задачи, которую можно эмпирически верифицировать: большой кусок кода, который сам не читал, вне продукта (в CI), с потоком данных для проверки.
- 0:57 Сгенерированный моделью код гоняли в shadow-режиме несколько недель, и он стабильно обгонял текущую реализацию, прежде чем его признали годным.
- 0:00 Модели дали корневые проблемы монолита: чинить import-циклы и делать приложение ленивым при бутстрапе питоновских модулей, и большая часть кода ушла в мёрж.
- 0:11 Понимать границу, где модель ломается, критично: именно эти задачи отдают людям на пробу, когда выходит следующий релиз.
- 2:00 Dynamic workflow срезал CI с 18 до 6 минут P50, оптимизация за оптимизацией, с повторным профилированием.
- 2:15 Агент сам запланировал себе перезапуск через день, чтобы собрать реальные продовые данные, и повторял это, пока не выбил все выигрыши.
- 1:55 Dynamic workflows это новая форма test-time compute: Claude оркестрирует суб-агенты, добавляя раунды состязательной верификации по потребности задачи.
- 3:14 Ментальная модель: ручка от low до max это максимум мышления, который модель может потратить, но не обязана.
- 3:43 Loops для повторяющегося, dynamic workflows для работы, где шаги заранее неизвестны (системная оптимизация).
- 4:16 Loops: горизонтальный срез (одна ежедневная задача каждого инженера: ревью, бэбиситтинг PR, удаление мёртвого кода); Claude-tag: вертикальный срез целой фичи.
- 5:07 Агент прогнал эксперимент end-to-end (создал, залил PR, мониторил экспозиции, выкатил вариант через недели), а человек только штампанул первый PR.
- 9:35 Фокус на отдельных трейсах, а не агрегатных бенчмарках: где модель должна была выполнить команду и почему не дошла - контекст, доступ, инструмент.
- 10:39 Промпты декларативные: говоришь что сделать, не как, «iPhone-опыт» с текстовым полем, а нужный трейс формируешь через инструменты и скиллы.
- 7:58 Скаффолдинг снимают снова и снова, потому что модель перерастает харнес: отсюда ставка на будущую модель, а не на 3.7.
- 10:13 Слоёная оборона и минимально необходимый доступ (read-only сервис-ключи) позволяют давать больше агентности, а не меньше.
Почему это важно
Ramp это финтех, где ошибка агента стоит реальных денег и данных клиентов, поэтому их подход работает как контрпример страху «пускать модель в прод». Выигрывают команды, которые перестают вылизывать обвязку под текущую модель и вкладываются в скорость плюс гардрейлы: команда безопасности здесь не тормоз, а строитель инфраструктуры и сама пользователь агентов. Anthropic (канал Claude, модель под кодовым именем Fable) получает витрину того, как фронтир-модель живёт во всём инженерном цикле; Ramp получает мультипликатор продуктивности и децентрализованную культуру, где каждый инженер лепит своих background-агентов поверх общих платформ вроде Inspect и Glass. Ставка на «интеллект будет дешеветь и расти» превращает текущие траты на токены в позитивный ROI, где минимизация стоимости уже вредна.
Идеи
- Критерий первой задачи для новой модели: код, который ты сам не читал, чтобы верификация была честной, а не самообманом.
- «Non-product place» специально: CI это песочница, где взрыв ограничен, и данных для проверки много.
- Shadow-режим на недели это способ доверять коду модели без веры на слово.
- Модель научили планировать собственный отложенный запуск, чтобы дождаться продовых метрик, а не выдавать результат по синтетике.
- Границу поломки модели используют как карту задач: то, где модель спотыкается сегодня, отдают людям и переиспытывают на следующем релизе.
- Ручка thinking стоит в самом конце пайплайна намеренно.
- «Making it sweat on hard problems», осознанная стратегия: гонять интеллект по сложному раньше, чем позже.
- Бэбиситтинг PR (фикс CI, автоматический ребейз) отдан в loop как чистая рутина.
- Удаление мёртвого кода это ежедневная routine, а не разовая уборка.
- Вертикальный агент ведёт A/B-эксперимент недели: балансирует экспозиции, крутит их вверх, потом выкатывает вариант отдельным PR.
- Сетап осознанно аскетичный: iTerm2, без IDE, минимум плагинов/скиллов/MCP, «vanilla», чтобы реально понимать модель.
- Сессии сместились в background и стали в основном сбором контекста («почему память течёт у сервиса»), а не программированием.
- Локальный dev держат для hands-on отладки и когда нужны сервисы/контекст на своей машине.
- Стало нужно физически носить ноут с приоткрытой крышкой, чтобы агенты «доваривали», поэтому пошёл переезд с локалки.
- Code-review бот подтягивает память о том, на что смотреть особо, плюс командные skill-файлы кодифицируют накопленное знание.
- По мере поумнения моделей меняют, на что смотрит ревьюер: не тратить ревьюер-токены на классы ошибок, которые модель перестала делать.
- Инспект-сессии всё чаще запускаются автоматизациями, а не людьми: триггеры по расписанию или из внешних систем.
- Adoption Inspect расползся через Slack: заходишь в чужой тред, пишешь «@Inspect, помоги», люди видят и подхватывают.
- Каждый PR приезжает со своей VM, сессии multiplayer, link-based, их можно перехватывать.
- On-call assistant это AI SRE на Cloud Code: рутит инциденты, кладёт RCA в Slack-канал, ставит PR-фиксы, работает с конца февраля.
- Архитектура децентрализована сознательно: платформенная команда держит bedrock-абстракции, остальные строят что хотят поверх.
- «Desire paths»: когда несколько команд лепят одно и то же порознь, платформа замечает и делает solid-версию.
- Для не-human автоматизаций берут дешёвые модели, batch и flex API, а фронтир держат для людей.
- Не хотят, чтобы фичи и люди оверфитились на поведение конкретной модели, поэтому всегда мигрируют на свежий фронтир.
- Cost-контроль через разговор: заметили резкий скачок трат у человека, пишут «что делаешь, давай заплатформим или удешевим».
- Позитивный ROI меняет оптику: если доллар токенов приносит больше доллара, минимизировать стоимость уже не надо.
- «Velocity bet»: то, что построишь под сегодня, быстро станет техдолгом, а прицел дальше в будущее даёт больше пройденного пути на тех же ресурсах.
Инсайты
- Верификация должна быть встроена в выбор самой задачи, а не пришита потом: агенту дают то, что можно проверить потоком данных, иначе доверие держится на вере.
- Полезнее картировать, где модель ломается, чем где она справляется: граница поломки это одновременно roadmap улучшений и разделитель труда человек/агент.
- Скаффолдинг вокруг модели это актив с отрицательным сроком годности: чем лучше обвязка под текущую модель, тем быстрее она станет техдолгом.
- Декларативный интерфейс (что, а не как) перекладывает знание о «правильном трейсе» из промпта в инструменты и скиллы и масштабируется вместе с ростом модели.
- Безопасность как строитель, а не привратник: чем больше слоёв защиты, тем больше агентности можно безопасно раздать, это инверсия обычного trade-off.
- Автономность агента ограничивают не умностью, а привилегиями: least-privilege и read-only ключи это дешёвый способ сделать худший исход неопасным.
- Отдельный трейс диагностичнее агрегатного бенчмарка: агрегат говорит «хуже», трейс говорит «почему» и что именно чинить.
- Организационно правильно оставлять хаос экспериментов внизу и кристаллизовать общее в платформу сверху, а не централизовать заранее.
- Снятие лимитов на токены сдвигает поведение людей к «прожиганию» интеллекта на сложном, что и есть цель: раньше нащупать потолок модели.
- Стоимость интеллекта это историческая нисходящая кривая, поэтому проектировать надо под будущую дешевизну, а не под сегодняшний ценник.
- Внимание к скорости изменения, а не к снимку возможностей, единственный способ не опоздать: строя под доступное сегодня, зашипишь уже поздно.
- Test-time compute это регулируемая ось: от thinking-ручки до оркестрации суб-агентов, один и тот же принцип «дай больше вычислений там, где задача просит».
Фреймворки
- Loops против dynamic workflows. Loops: повторяемая работа с известными шагами (бэбиситтинг PR, удаление мёртвого кода, ежедневные routines). Dynamic workflows: динамическая работа, где шаги заранее неизвестны (системная оптимизация); Claude оркестрирует суб-агенты параллельно или последовательно, добавляя раунды состязательной верификации.
- Горизонталь против вертикали. Loop: горизонтальный срез: одна задача, которую каждый инженер делает ежедневно. Claude-tag/Inspect: вертикальный срез: целая фича end-to-end (эксперимент, PR, мониторинг, выкат варианта).
- Ручка test-time compute: low → medium → high → extra high → max: это максимум мышления, доступный модели; она не обязана его весь тратить. Стоит в конце пайплайна.
- Правильный трейс. Держи в голове, что агент должен сделать (сначала запросить этот источник, потом эти, прочитать код в тех репах) и формируй его поведение через промпты, инструменты и скиллы, пока трейс не совпадёт.
- Минимально необходимый доступ. На каждом слое стека: дать модели всё, что нужно, и ничего сверх (read-only сервис-ключи к BigQuery/Datadog, network policies от команды безопасности).
Цитаты
«Really understanding what the boundary of where these models break is very important», 0:11 Понимать границу, где эти модели ломаются, критически важно
«This is the first model that just did all the things», 1:40 Это первая модель, которая просто сделала всё
«It's like a new form of test time compute», 1:55 Это как новая форма test-time compute
«It just, like, optimization after optimization after optimization, and they just kept profiling it», 2:09 Оптимизация за оптимизацией за оптимизацией, и оно просто продолжало профилировать
«Loops are kind of like repetitive work and dynamic workflows are like dynamic work», 3:43 Loops это повторяющаяся работа, а dynamic workflows динамическая
«And I wasn't in the loop at all», 5:07 И я вообще не участвовал в процессе
«Sometimes you just got to let them cook, get out of the way», 6:37 Иногда надо просто дать им повариться и уйти с дороги
«Maybe we shouldn't build for 3.7. Maybe we should build for whatever's coming next», 7:43 Может, не надо строить под 3.7. Может, надо строить под то, что придёт следом
«The model's just outgrown the harness», 7:58 Модель просто переросла харнес
«We've done everything we can to give the model what it needs, but nothing more», 10:13 Мы сделали всё, чтобы дать модели то, что ей нужно, и ничего сверх
«The prompts must be declarative», 10:39 Промпты должны быть декларативными
«Just by focusing on what the correct trace in your head is, you can then shape the agent trace», 11:05 Просто держа в голове правильный трейс, ты формируешь трейс агента
«You've just got to trust that it will get there... just ship it and you just wait», 11:20 Надо просто верить, что оно дойдёт: зашипь и жди
«Good old-fashioned hard controls on top of that... principle of least privilege», 11:25 Старые добрые жёсткие контроли поверх, принцип наименьших привилегий
«As the models get smarter, they stop making certain classes at the stakes», 12:36 Когда модели умнеют, они перестают делать определённые классы ошибок
«It's not worth spending your reviewer tokens on that anymore», 12:42 Тратить на это токены ревьюера больше не стоит
«If you are in the positive ROI section... you actually don't want to be minimizing the cost anymore», 20:19 Если ты в зоне положительного ROI, минимизировать стоимость уже не надо
«Making it sweat on hard problems sooner than later», 20:40 Заставлять его потеть над сложными задачами раньше, чем позже
«Sometimes when you're playing catch up and you're building for what's available today it might already be too late by the time you ship», 21:29 Когда догоняешь и строишь под доступное сегодня, к моменту релиза уже может быть поздно
«The stuff you can build on the primitives, on this sort of Unix philosophy, Cloud Code executable, it's just wild», 16:54 То, что можно построить на примитивах, на этой Unix-философии, Cloud Code просто дичь
Факты
- Один dynamic workflow срезал время CI с 18 минут P50 до 6 минут P50 (за день до записи).
- Сгенерированный моделью код по CI гоняли в shadow-режиме несколько недель перед принятием.
- Спикер упоминает оркестрацию 40 или 100 суб-агентов в фоне в рамках dynamic workflows (порядок величины, не точная цифра).
- Ручка test-time compute: low → medium → high → extra high → max.
- On-call assistant работает с конца февраля / марта, всегда на Cloud Code; обрабатывает и клиентские тикеты, требующие инженера, и системные инциденты.
- Inspect: внутренний background-агент («digital co-worker»), запускается на modal, доступ через web и Slack; интегрирован с GitHub, Linear, Slack, Datadog, Sentry, Zendesk.
- Glass («Project Glass»): домашняя база для нетехнических сотрудников, где они ежедневно общаются с кодинг-агентом.
- Каждый PR приезжает со своей VM, сессии multiplayer, link-based, перехватываемые.
- Code-review бот построен на Inspect (их background agents API), тянет из памяти и командных skill-файлов.
- Начинали думать про сборку не под Claude 3.7 (в SRT «3.7»), а под следующие модели.
- Команда безопасности сама построила инфраструктуру: network access policies, выдача ключей; они же регулярные пользователи агентов.
- Прицел планирования: строить под то, что придёт через 3–6 месяцев.
- Для не-human автоматизаций используют batch и flex API и более дешёвые модели.
- Cost-контроль частично ручной: замечают резкий рост трат у отдельного человека за месяц и связываются лично.
- Модель в разговоре носит кодовое имя Fable (в SRT местами «Quad»/«Quad tag», whisper-искажение «Claude»/«Claude tag»); спикеры Austin и Rahul из Ramp.
Источники
- Cloud Code / Claude Code: CLI-агент, на котором построены внутренние инструменты Ramp.
- Inspect: внутренний background-агент Ramp и API фоновых агентов.
- Glass (Project Glass): интерфейс для нетехнических сотрудников.
- On-call assistant: AI SRE на Cloud Code.
- Cloud Tag / Claude Tag: мультиплеерный проактивный агент в Slack.
- modal: платформа, на которой запускается Inspect в фоне.
- Внешние системы в интеграциях: GitHub, Linear, Slack, Datadog, Sentry, Zendesk, BigQuery, Redis.
- Anthropic API: batch и flex режимы.
- Упомянута вдохновившая cloud.md конфигурация из Twitter-постов одного из участников про «vanilla setup».
Итог
Не вылизывай обвязку под сегодняшнюю модель: дай агенту роль коллеги, минимально необходимый доступ под жёсткими гардрейлами и строй под интеллект, который придёт через полгода, потому что скорость роста моделей бьёт их текущий снимок.


