Коротко
Gabe Pereyra, сооснователь и президент Harvey, показывает плейбук: как компания уровня приложения строит собственную research-лабораторию, не имея денег, талантов и компьютера фронтир-лабораторий. Вся ставка на Frontier ecosystem: набор молодых компаний (NeoLabs, инфра, разметчики), которых четыре года назад не существовало, а теперь они закрывают то, что раньше пришлось бы строить руками. Три опоры плейбука: сначала бенчмарк, потом пост-тренинг открытых моделей через NeoLabs, потом сервинг в проде с готовой инфраструктурой оценки и мониторинга. Ключевой анлок года: синтетические данные под управлением доменных экспертов, юристы «вайб-кодят» реалистичные data room'ы, потому что реальные данные клиентов privileged и обучать на них нельзя. Финал построен на цитате из «Moneyball»: выиграешь на этом бюджете с этой командой, поменяешь правила игры.
Главный тезис
Компания на уровне приложения больше не обязана строить фронтир-интеллект сама: собери бенчмарк, обучи открытые модели чужими руками через фронтир-экосистему, встрой это в уже работающий продакшн, и на своём бюджете конкурируй с фронтир-лабами.
Ключевые идеи
- 0:51: игра изначально нечестная, у фронтир-лабов больше денег, талантов, компьютера, инфраструктуры и данных, у приложенца нет ничего из этого
- 1:16: единственный способ конкурировать, чужая экосистема, которой четыре года назад не было, а теперь она закрывает то, что раньше строили сами
- 2:07: всё начинается с бенчмарка, нет бенчмарка, не обучишь модель, не обучишь, нечего сервить
- 3:18: данные клиентов privileged, их нельзя класть даже в свои модели, поэтому обычный путь обучения закрыт
- 3:39: анлок года, доменные эксперты рулят генерацией синтетики, как инженеры теперь вайб-кодят, а не пишут код
- 15:56: трюк генерации, сначала рубрика с подсаженными проблемами, потом из неё генерят сам data room, потом проверяют, поймала ли модель заложенные ошибки
- 4:14: синтетика это старт, а не финиш, дальше масштабирование через Mercore и Snorkel
- 5:11: открытие датасетов было спорным, но иначе не узнаешь, что датасет хорош, чужие обучаются, находят баги, шлют pull requests
- 6:00: раньше пост-тренинг съедала следующая претрен-модель, теперь открытые модели дозрели до пост-тренинга под конкретную задачу
- 6:38: стартовать надо с NeoLabs, у них рецепты и инфра, если с ними результат не растёт, виноват твой датасет
- 7:34: работают с несколькими лабами, потому что проектов больше, чем bandwidth, и каждая лаба делает свою ставку
- 8:49: сервинг нетривиален, 60 стран, разные продуктовые поверхности, разные предпочтения клиентов по моделям, фолбэки между провайдерами под SLA
- 10:01: инфра оценки и мониторинга нужна до пост-тренинга, пост-трейн-модель проходит те же ворота, что любая новая
- 12:01: начни с простых свопов, где можно наивно подменить закрытую модель открытой ради цены, потом роутинг по типам запросов
- 27:38: сдвиг продукта от индивидуальной продуктивности к организационной, не «черкани секцию», а оркестрация людей и агентов на проекте в 6 месяцев
Почему это важно
Это карта для всего application-слоя. Пока фронтир-лабы жгут миллиарды на общий интеллект, Harvey показывает: под узкую задачу открытую модель можно дотянуть до фронтира чужими руками, и вокруг этого уже выросла целая индустрия-подрядчик: NeoLabs (Fireworks, Base 10, Applied Compute, Trajectory, Inconnu-лабы), разметчики (Mercore, Snorkel), API вроде Tinker, инфра сервинга. Выигрывают приложенцы с готовым product-market-fit и живым продакшном: у них есть петля обратной связи, куда пост-тренинг встраивается как один маленький вход. Лабам это тоже выгодно: Harvey шарит данные, они калибруют модели, продукт Harvey от этого лучше. Проигрывает старая интуиция «просто построй лучшую модель, и клиент придёт»: у каждого клиента свои предпочтения, разные модели сильны в разном.
Идеи
- Бенчмарки Harvey за год: Legal Agent Bench (таксономия задач младшего юриста), контрактный датасет (переговоры in-house), большой diligence-датасет
- Diligence-датасет заявлен как один из крупнейших опубликованных RL-окружений: самые большие data room'ы, 80 млн токенов
- В diligence больше 1000 юнит-тестов, оценивающих выход модели через LLM-as-a-judge
- На больших моделях RL-роллауты с тысячей LLM-судей взрывают стоимость оценки, отсюда работа с Langchain над эффективностью
- Аналогия Brendan из команды: инженеры теперь не пишут код, а вайб-кодят и направляют модель, юристы делают то же с генерацией данных
- Младший брат Гейба, юрист в Harvey, один из первых наймов, четыре года работает с моделями, натаскал остальных юристов
- Публичные ImageNet, CIFAR, MNIST были лучшими именно потому, что на них обучались все и вылавливали дефекты
- «Самое главное, Elon сделал ретвит»: брошено как полушутка про пользу открытия датасета
- Для узкой задачи открытая модель конкурентна, для общего фронтир-интеллекта, может, и нет
- Свежие открытые базы, названные в докладе: Kimi K2 (в SRT «Kim E3»), GLM, Nemotron, и другие
- Fireworks: тренировали GLM с моделью-советником (Fable/Opus) как advisor
- Base 10: работа над KV-компакцией; Trajectory: тренировка Nemotron; Applied Compute: продукт Vault
- Цель, вдохновлённая Cursor: собрать свою версию Composer 1, упаковать всю работу в модель, которую сервят рядом с закрытыми
- Матрица сервинга: под каждое семейство моделей несколько моделей, фолбэки между провайдерами под SLA
- Пре-прод ворота: авто-бенчмарк лаборатории, human side-by-side, critical user journeys, авто-продуктовые тесты, human product testing
- Пост-прод сигналы: A/B, engagement, uptime, token efficiency, и «злые письма клиентов» вместо вежливого «product feedback»
- Модель может перформить на бенчмарке, но переобучиться и развалиться в дженерик-ассистенте на out-of-distribution
- Генерируемые датасеты «смотрят в будущее»: их распределение не совпадает с продовым, в проде diligence пока не основной сценарий
- Ранняя ошибка найма: звал знакомых из лабов, а те получали пакеты 100 млн+, Harvey был не того масштаба
- Теперь пул шире: PhD-шники и те, кто не хочет в большие лабы; talent раньше нужен был не под пост-тренинг, а под постройку тренинг- и сервинг-инфры
- Старый сосед по комнате Гейба руководил пост-тренингом в OpenAI, один из лучших исследователей, с кем он работал
- Chicken-and-egg с юрфирмами: «обучим модель на ваших данных» → «докажи» → «покажите данные» → «нет»; синтетика разрывает круг
- End-game: не лучшая юр-модель, а continual learning: каждый клиентский кейс делает AI фирмы умнее, но данные клиента защищены
- Про открытие бенчмарка прямая напряжёнка: откроешь, трекшн, но лабы могут «зажать»; закроешь, вопрос «а настоящий ли это бенчмарк»
- Enterprise-сценарий сложнее фирменного: Fortune 500 работает с тысячей юрфирм и тысячей своих людей, всё это надо оркестрировать
- Ответ на конкуренцию с Codex/Claude Code: уходить гипер-вертикально в домен так, как горизонтальный продукт не полезет
Инсайты
- Ассиметрия ресурсов не приговор, если рынок предоставляет её по частям как сервис: собери фронтир из чужих кусков вместо владения ими
- Обучение на синтетике меняет узкое место с «где взять данные» на «кто умеет ставить задачу», ценность утекает от обладателя данных к доменному эксперту-постановщику
- Генерация «от рубрики к данным» переворачивает пайплайн: сначала знаешь правильный ответ и заложенные дефекты, потом строишь вход, оценка встроена by design
- Открытость датасета это форма распределённого QA: качество нельзя доказать в одиночку, только массовым чужим обучением
- Претрен, съедающий пост-тренинг, был структурным запретом на нишевую доводку; его снятие открывает целый слой экономики
- Инфраструктура оценки первична по отношению к любому обучению: без ворот приёмки пост-тренинг некуда встроить
- Product-market-fit на закрытых моделях служит фундаментом, который превращает пост-тренинг в дешёвый инкремент, а не в ставку ва-банк
- Мульти-вендор не хедж, а способ купить чужие разнонаправленные ставки на исследования, когда своего bandwidth не хватает
- Хороший бенчмарк не гарантирует прод: расхождение распределений бенчмарка и реального использования, это постоянный, а не устраняемый разрыв
- Барьер найма исследователей упал не потому, что подешевел талант, а потому, что API съели необходимость строить инфру, под которую этот талант и был нужен
- Настоящая защищённость приложенца не в лучшей модели, а в приватных данных клиента и вертикальной оркестрации, куда горизонтальный игрок не зайдёт
- Продуктовая граница смещается от индивидуальной продуктивности к координации организации, там, где горизонтальный ассистент бессилен
Цитаты
«There are rich teams, there are poor teams, and then there's us in the application layer», 0:59 Есть богатые команды, есть бедные, а есть мы, на уровне приложения
«It's an unfair game competing with the frontier Labs if you're an application layer company», 0:51 Это нечестная игра: конкурировать с фронтир-лабами, если ты компания уровня приложения
«If you don't have a good benchmark, you can't train models», 2:07 Нет хорошего бенчмарка, не обучишь модели
«We can't train on our customers' data», 3:18 Мы не можем обучаться на данных наших клиентов
«The same way that engineers now don't write code, they vibe code», 3:48 Так же, как инженеры теперь не пишут код, а вайб-кодят
«Synthetic data isn't good enough, but it's a way to get started», 4:14 Синтетика недостаточно хороша, но с неё можно начать
«It's very hard to know your data set is good unless a lot of people train on it», 5:18 Очень трудно понять, что твой датасет хорош, пока на нём не обучится много людей
«And then most importantly, we had Elon retweet it», 5:46 И, самое главное, Elon сделал ретвит
«I call it angry customer emails», 11:42 Я называю это злыми письмами клиентов
«A model could be very good generically, but it could not be a good fit for a specific product surface», 10:52 Модель может быть хороша в общем, но не подойти под конкретную продуктовую поверхность
«You need to be very careful about what collecting feedback means», 12:56 Нужно очень аккуратно определять, что значит собирать обратную связь
«Every ai every company is going to need to become an ai company», 13:24 Каждой компании придётся стать AI-компанией
«Most people are still betting against this playbook», 13:32 Большинство до сих пор ставит против этого плейбука
«But if we win on this budget, with this team will have changed the game», 14:18 Но если мы выиграем на этом бюджете и с этой командой, мы поменяем правила игры
«They'd be like, OK, prove it. And we were like, show us the data. And they're like, no», 16:54 Они: «Ну докажи». Мы: «Покажите данные». Они: «Нет»
«The end game here is not for us to build the best legal model», 26:15 Конечная цель не в том, чтобы построить лучшую юридическую модель
«Go change the game», 14:32 Идите и поменяйте правила игры
Факты
- Gabe Pereyra, сооснователь и президент Harvey; был research scientist в DeepMind (и раньше в Google Brain), затем в Meta; Harvey вырос из того, что он показал соседу по комнате возможности GPT-3
- Harvey основан примерно 4 года назад (доклад на площадке Sequoia Capital)
- За год выпущено три датасета: Legal Agent Bench, контрактный датасет, большой diligence-датасет
- Самые крупные data room'ы в diligence-датасете: 80 млн токенов; в проекте более 1000 юнит-тестов с LLM-as-a-judge
- Harvey работает в 60 странах, несколько продуктовых поверхностей, разные модельные предпочтения клиентов
- Партнёры по разметке/масштабированию синтетики: Mercore, Snorkel; по эффективности RL: Langchain
- NeoLabs-партнёры: Fireworks (GLM с advisor-моделью), Base 10 (KV-компакция), Engram (enterprise search), Trajectory (Nemotron), Applied Compute (продукт Vault)
- Инструменты пост-тренинга своими силами: API вроде Tinker, инфра Fireworks и Base 10
- Названные открытые базовые модели: Kimi K2 (в SRT «Kim E3»), GLM, Nemotron, и др., конкурентны под узкую задачу
- Цель по своей модели вдохновлена Cursor и их Composer 1
- Ранние наймы из лабов уходили за пакеты 100 млн+, что было не по масштабу Harvey на тот момент
- Старый сосед Гейба по комнате руководил пост-тренингом в OpenAI
- Пример с брендами: брат Гейба (юрист) и Julio описаны как те, кто отладил генерацию синтетических data room'ов от рубрики
- Продуктовые конкуренты на горизонтали, названные из зала: Codex, Claude Code / Cowork
- Финальная рамка доклада: сцена из фильма «Moneyball», слова Billy Beane про победу на бюджете
Источники
- Фильм «Moneyball» (Billy Beane): финальная метафора доклада
- Открытые датасеты как эталон: ImageNet, CIFAR, MNIST
- Компании/инструменты: Harvey, DeepMind, Google Brain, Meta, OpenAI, Sequoia, Mercore, Snorkel, Langchain, Fireworks, Base 10, Engram, Trajectory, Applied Compute, Tinker, Cursor (Composer 1)
- Открытые модели: Kimi K2, GLM, Nemotron
Итог
Не строй фронтир, арендуй его по частям: бенчмарк своими руками, пост-тренинг чужими, сервинг поверх живого продакшна, и на своём нищем бюджете ты обыгрываешь тех, у кого есть всё.