Агенты VS чат: на результат влияет обвязка вокруг модели
Открытый эфир от 18 августа 2026 года, два часа с небольшим. Ниже — конспект по темам: его можно читать вместо видео, а можно рядом с ним — каждый раздел начинается со ссылки на нужную минуту записи.
Этот эфир вырос из простого наблюдения. Рассказываешь знакомым, что умеют агенты, а в ответ слышишь: «Да мы пользуемся, у нас же чат». Слова «агент», «чат» и «ИИ» слились для многих в одно, а разница между ними тем временем стала принципиальной — и по тому, какую работу можно делегировать, и по тому, что для этого нужно уметь. Эфир мы вели вдвоём с Яковом Васильевым, моим партнёром по образовательной программе, и построили его максимально практично: меньше слайдов, больше живых демонстраций, включая те, что ломались прямо в эфире. Разбирали всё на исследовательских задачах, но работа с данными и документами нужна далеко не только в ресёрче.
Агент — это не модель, а модель плюс обвязка вокруг неё. На саму модель мы почти не влияем, зато на всё остальное влияем полностью. Поэтому результат определяет настройка обвязки, а не выбор модели.
Что такое агент
Я начал с вопроса к залу, и ответы сложились в довольно точное определение: агент принимает задачу, дальше выполняет её автономно, умеет обращаться с инструментами и через них влиять на внешний мир. В формулировке OpenAI это звучит так: агенты — системы, которые самостоятельно выполняют задачи от вашего лица. Оговорка «от вашего лица» здесь, похоже, юридическая: разработчики не хотят, чтобы агент действовал от их имени.
Классическая схема агента выглядит так: в центре модель, вокруг неё память, набор инструментов, планирование с самокритикой и собственно действие. Дальше мы разбирали устройство агента с той стороны, где у оператора есть влияние.

Чат рассказывает рецепт, агент варит борщ
Юлия Урасова, дизайн-директор и консультант, приводит хороший пример. Работа с чатом — это когда вы звоните маме и спрашиваете, как сварить борщ: она диктует, что купить и что порезать, а режете, варите и моете посуду вы сами, в прямом эфире и второпях. Работа с агентом — это когда вы ставите задачу, отдаёте доступ к нужным инструментам и получаете на выходе готовое блюдо. Где-то по дороге он может уточнить, окрошка будет на квасе или на кефире, а может и не уточнять — если знает ваши вкусы.
Разница не в словах, а в том, кто делает работу. Чат отвечает текстом, и восемьдесят процентов дела остаётся на вас. Агент действует: ходит в интернет, пишет и запускает код, создаёт и правит файлы у вас на компьютере.
Две шкалы агентности: автономность и инструменты
Чтобы не спорить о словах, полезно развести системы по двум осям: степень самостоятельности и доступность инструментов. Внизу слева — обычная генерация текста в диалоге, это ещё не агент. Чуть выше — чат, который сам решает, когда сходить в интернет, создать файл или написать код: агентность здесь уже появилась, но остаётся внутри песочницы провайдера, то есть изолированного окружения, правила которого задаёте не вы. Дальше идут агенты, которые живут прямо на вашем компьютере, — Claude Code и Codex: в их распоряжении вся машина, терминал, любой код и весь интернет. А в правом верхнем углу — запуск на сервере и связки из нескольких агентов, работающие без вас.
Отсюда простой вывод: агентность — это градиент, а не выключатель. Любого агента можно связать по рукам и ногам, заперев в чужом окружении, и агентом он быть перестанет. Понимать, где именно вы находитесь на этих шкалах, стоит не ради классификации, а чтобы система не была для вас чёрным ящиком: тогда вы сможете объяснить себе, почему она делает то, что делает.

Вопросы из чата. Режим Work в GPT — это агент? А computer, который появился в Perplexity? Ответ на все такие вопросы сегодня один: агент. Почему тогда и обычный чат — агент? Потому что он уже сам решает, какой инструмент запустить и каким путём пойти, и к нему подключаются и документы, и почта, и много чего ещё. Агентское поведение у него есть, просто ручек управления вам не дали. Подозреваю, что довольно скоро чат как отдельный режим вообще уберут и оставят агентские.
Проект — это папка
В чате единица работы — сам чат: закрыли окно, и всё осталось в переписке. У агента единица работы — проект, а проект физически равен папке на компьютере. Это первое, обо что спотыкаются: нас годами приучали, что есть рабочий стол и облако, куда всё складывается само, а тут снова приходится думать про файлы и каталоги.
Контраст хорошо виден на простом запросе: я попросил чат сделать документ с рекомендациями по проведению интервью. Он написал текст и вежливо предложил скопировать его в Word, Google Docs или Notion — то есть доделать руками. Никуда не сходил, ничего не создал, ответил из весов, то есть из знаний, зашитых в модель при обучении.
Вопрос из чата. Может ли агент сам создавать папки, если дать ему полный доступ к компьютеру, — или лучше управлять этим руками? Должен создавать, и к этому стоит стремиться. Я обычно завожу папку под проект сам, кладу туда файлы с нужным контекстом, а дальше он хозяйничает внутри: заводит подпапки, раскладывает файлы, держит структуру. В конце сессии у меня для него есть отдельная команда уборки — она разносит временные файлы по местам и обновляет память проекта.
Демо: агент собирает документ с презентацией
Тот же запрос я отдал агенту, но сформулировал шире: найди хорошие практики проведения интервью, найди логотип нашего агентства и собери из этого документ и презентацию на одну страницу с лаконичным дизайном. Ни источников, ни картинок я не давал — разбираться он должен был сам.
Дальше он запустил скилл поиска в интернете. Скилл (skill) — это заранее заготовленная инструкция, которую агент подключает под конкретную задачу; о том, как они устроены, будет отдельный раздел ниже. Агент сходил на сайт агентства за логотипом, собрал практики с профильных ресурсов, написал документ в Markdown — простой текстовой разметке, где заголовки, списки и ссылки задаются обычными символами, — прогнал текст через мой скилл редактуры, чтобы он не звучал на нейросетевом сленге, и собрал презентацию. Для презентации ему пришлось написать код: файл формата PPTX — это презентация PowerPoint, и собирается она программой на языке JavaScript. На всё ушло две минуты тридцать девять секунд автономной работы. Вопросов он мне не задавал: контекста хватило.
Следующим шагом я попросил сделать из этого сайт с интерактивным тестом на закрепление — агент собрал его и опубликовал. Задачу я при этом надиктовал голосом: голосовой ввод удобен именно тем, что вы отдаёте агенту в разы больше контекста, чем напечатали бы руками. Ключевое здесь — давать ему то, чего он сам знать не может.
Память проекта
Раз проект — это папка, то и память живёт в папке. У меня в каждом проекте лежит README.md с описанием и навигацией, чтобы агент не перечитывал всю папку заново; progress.md, куда он записывает, что сделал в каждую сессию и какие выводы из этого следуют; и CLAUDE.md, который подгружается в контекст всегда — то есть попадает в текст, который модель получает на вход при каждом запуске. Благодаря этому агент приходит в проект с пустым чатом, читает файлы и продолжает работу с того места, где её бросили.
Здесь же лечится классическая боль: если агент ошибся, он записывает правило, чтобы не повторять ошибку, и в следующий раз опирается на него. Память — это не магия модели, а несколько текстовых файлов, которые вы сознательно ведёте.
Вопрос из чата. Как быть с общей памятью, если в одной папке работаешь то Claude Code, то Codex, то Cursor — переключаешься, когда у одного кончились лимиты? Практика вполне рабочая, и держится она на процедуре передачи дел (handoff) в конце сессии. В папке заводятся два файла — CLAUDE.md и AGENTS.md, — которые обновляются синхронно и ссылаются на README.md и progress.md, где лежат навигация и журнал проекта. Тогда любой агент, запущенный в этой папке, прочитает их и поймёт, на чём вы остановились. На GitHub есть и готовые скиллы под такую передачу.
Запуск агента в терминале
Технически всё просто: командой cd перейти в нужную папку и запустить агента — он откроется прямо в ней и спросит, доверяете ли вы этому каталогу. Мы с Яковом работаем в терминале и на лаборатории учим тому же, хотя ровно те же вещи можно делать и в настольном приложении.
Причина простая. В терминале меньше отвлекающих элементов интерфейса, а главное — видно, что агент делает прямо сейчас: вот он запустил программу на Python, вот создал файл с данными в формате JSON. Понимать это полезно, даже если вы не пишете код и не собираетесь. Я сам ещё пару лет назад раздражался от одного вида чёрного окна с буквами, а теперь сижу в нём постоянно.
Вопросы из чата. Чем терминал лучше родного приложения? Отчасти это вкусовщина — возможности плюс-минус одинаковые, хотя новые функции в терминале появляются раньше. Но фокуса он даёт больше: лишнего интерфейса нет, зато есть строка состояния, куда можно вывести что угодно — заполнение контекстного окна, расход лимитов, рабочую папку. И не приходится держать открытыми десяток окон. Каким IDE, то есть средой разработки, пользуемся? Я сижу в терминале, а Cursor держу как редактор Markdown, но и VS Code, и Cursor вполне годятся. Начинать при этом можно с чего угодно.
Чем коворк отличается от Claude Code
Об этом спросили из зала, и вопрос стоит разобрать отдельно: кнопок на этой микроволновке становится всё больше. Разница между облачными режимами вроде коворка (Cowork) и агентом, который работает прямо у вас на машине, — в периметре. В облаке агент живёт в виртуальном окружении провайдера: вам не нужно ставить себе Python, зато вы играете по чужим правилам. Захотите вытащить расшифровку с чужого ролика — можете услышать, что по правилам так нельзя.
На своём компьютере вы сами решаете, что разрешено. Агент свободно ходит по проектам, берёт из одного личные данные, чтобы заполнить документ в другом, кладёт результат в приложение для заметок Obsidian или на Google Drive. Плата за это — ответственность: объём разрешений вы выдаёте под собственный аппетит к риску.
Вопросы из чата. Work в ChatGPT — это отдельная сущность? Нет, по сути это Codex. Дальше участники поделились наблюдениями: у части из них коворк оказался заметно менее агентным, чаще и раньше останавливался; другие возразили, что и коворк, и Work уже создают файлы локально, так что граница между режимами намеренно размывается обоими вендорами. Похоже, так и есть — тем важнее понимать, где именно проходит граница периметра у вашего конкретного инструмента.
Агент — новый пользователь вашего компьютера
Здесь Яков добавил важный технический момент. Когда агент работает всерьёз, он запускает огромное количество небольших программ-скриптов, гоняет тесты, делает запросы к базам данных, переписывает файлы — и в эти моменты от модели требуется только одно: вовремя вызвать правильный инструмент. Вся остальная работа происходит на машине. Если гнать её через облако, получится либо медленно, либо дорого, либо и то и другое сразу.
Отсюда наш общий тезис: агент — это новый пользователь вашего компьютера. А компьютером пользуются не только для того, чтобы ходить в интернет: на нём есть файлы, папки и программы, и без сети тоже можно работать. Если своя машина слабая, разумный выход — не облачный режим, а собственный сервер, то есть просто другой компьютер, отданный агенту.
Harness: всё, что окружает модель
Дальше Яков показал свою схему. Агент раскладывается на модель и обвязку вокруг неё — по-английски её называют harness, «упряжь». В обвязке восемь элементов. Цель с критерием готовности, по которому агент понимает, что работа закончена. Триггер, то есть то, что даёт старт работе: человек, расписание (его задают планировщиком cron, который включает задачу в назначенное время) или хук (hook) — автоматический сигнал от другой системы, на который агент реагирует. Контекст, который мы кладём в окно модели. Память, живущая между сессиями. Инструменты — браузер, программные интерфейсы (API), по которым агент обращается к внешним сервисам, и MCP (Model Context Protocol, протокол, по которому модель подключается к внешним инструментам и данным). Проверка через тесты и самокритику. Лимиты и права — сколько шагов, сколько денег, куда пускаем. Среда, в которой всё это живёт, от репозитория с файлами проекта до сервера. В центре этой конструкции крутится модель, а на выходе получается не ответ в переписке, а результат: коммит (сохранённая правка в системе контроля версий), файл, отчёт.

Физически обвязка выглядит как папка на компьютере — .claude, .codex, .cursor — с файлами, где прописано, как агент работает, какие у него разрешения и настройки, в какой логике он запускается. Всё это можно открыть и прочитать. Обвязки постепенно становятся публичными: свою, например, открыли в Grok.
Вопрос из чата. Так всё-таки обвязка — это набор файлов с правилами или сведения о контексте работы агента? Это все настройки и конфигурации вокруг агента, физически — папка с ними. Заодно стоит развести соседние понятия, вокруг которых в чате возникла путаница. Агент — это система, которая по команде автономно выполняет задание и вызывает инструменты. «Роль» агента вроде дизайнера — не отдельная сущность, а просто заданный ему контекст и набор скиллов под определённый класс задач. Оркестратор — агент, который управляет другими агентами. А обвязка — не дирижёр и не оркестратор, а именно конфигурация, которая помогает агентам достигать цели и не путаться. Все агенты процесса — и оркестратор, и субагенты — работают на одной обвязке.
Harness — это способ наладки эффективности твоего агента. И под каждый проект ты налаживаешь, по сути, новый harness.
Проверка и эвалы
Модели работают циклами и умеют откатываться назад, если очередной подход к задаче не сработал, — но для этого им нужны самокритика и тесты. Иначе в проект закладываются мины замедленного действия, которые срабатывают уже после сдачи работы. Поэтому агент должен двигаться небольшими шагами и после каждого проверять, что именно он сделал.
Когда агентный процесс сам является рабочим инструментом, а не пишет программу, роль тестов играют эталонные документы. Вы один раз доводите прогон до состояния, которое вас устраивает, и сохраняете его как образец — это и есть проверки качества, по-английски evaluations, в обиходе «эвалы». Каждый следующий запуск вы сравниваете с этим образцом. Без такой процедуры процесс нельзя ни отдать коллегам, ни поставить на сервер.
Сюда же примыкает экономика. Тяжёлый агентный процесс способен съесть все лимиты подписки, и злиться вы будете на агента, хотя дело в конструкции. Рабочий приём такой: собирать процесс на дорогой умной модели, а когда он отлажен, пересадить его на дешёвую и прогнать эвалы. Часто оказывается, что умная модель была нужна только на этапе сборки.
Минимальный набор, чтобы начать
Набор для старта небольшой. Нужна подписка за двадцать долларов — у Anthropic или у OpenAI, агент в неё уже входит. Дальше ставится сам агент: Claude Code в терминале или настольное приложение, кому как удобнее. Пригодятся терминал, редактор для файлов Markdown, язык Python, среда Node.js, менеджер программ Homebrew и система контроля версий Git, которая хранит историю изменений и позволяет откатиться назад, — но всё это агент при необходимости поставит себе сам. И, конечно, нужна папка на компьютере, в которой он будет работать.

Вопрос из чата. Как получить доступ и не словить блокировку? Правило простое: карта, VPN и телефон лучше держать в одном регионе и не выпадать оттуда в другие адреса.
Качественник и количественник: граница стирается
Границы между профессиями начали протекать, и это видно по данным. Исследователи OpenAI посмотрели, какие задачи разные роли отдают агентам, и оказалось, что заметная доля запросов лежит за пределами собственной должностной инструкции: дизайнер на двадцать восемь процентов разговаривает с агентом про инженерию, инженер занимается маркетингом, а специалист по клиентскому опыту — и дизайном, и финансами, и всем сразу.

Внутри исследовательской профессии происходит то же самое: граница между качественниками, которые работают с интервью и наблюдениями, и количественниками, которые работают с цифрами, размывается. Раньше, чтобы работать с количественными данными, нужно было два года учить SQL — язык запросов к базам данных — и осваивать статистические пакеты. Сейчас вы берёте вчерашнюю сырую выгрузку опроса и за несколько минут получаете отчёт и дашборд (dashboard) — интерактивную панель, на которой данные разложены по нужным разрезам. Методология при этом никуда не девается: без неё легко получить красивую картинку вместо осмысленного результата. Но её как раз можно выучить.
Кейс 1: дашборд из сырой выгрузки
Первый кейс — про то, что человек без опыта работы с количественными данными теперь способен их обработать. В папке лежит один файл: выгрузка интернет-магазина чая и кофе, где по каждому визиту записаны канал, устройство, новый пользователь или вернувшийся, глубина просмотра, время на сайте, факт покупки, категория и сумма.
Первое задание агенту сознательно скромное: изучи набор данных (датасет), посмотри, насколько он грязный, есть ли пропуски и битые значения, и опиши его в отдельном файле — что в каких колонках лежит. Инсайтов пока не ищи. Этот шаг важен, потому что дальше всё выстраивается в конвейер: сначала карта данных, потом чистка кодом, потом база, потом проверочные запросы и только затем интерпретация. Хранение и добыча данных остаются детерминированными — то есть их выполняет точный алгоритм, который на одних и тех же данных каждый раз даёт один и тот же результат, — а за творческую часть отвечают отдельные агенты.

Дальше я попросил собрать интерактивный дашборд с нужными разрезами и текстовыми выводами. Получилось за несколько минут: видно, как проседал один рекламный канал и как в тот же момент выстрелил другой. Ценность здесь не в скорости сборки, а в том, куда уходит освободившееся время. Раньше неделя тратилась на то, чтобы аналитик нашёл окно в календаре и разобрался с данными; теперь вы за полчаса до встречи готовите дашборд и приходите обсуждать бизнес-вопросы, а не таблицу.
Почему CSV и JSON, а не Excel
Ещё один секрет работы с агентами: давать им удобные для них файлы. Excel и PowerPoint придуманы для людей — это форматы, которые в первую очередь обеспечивают визуальное удобство чтения. А вот CSV (comma-separated values — таблица, записанная обычным текстом, где ячейки разделены запятыми), JSON (текстовый формат для структурированных данных, где у каждого значения есть имя) и SQLite (компактная база данных, которая целиком помещается в один файл) придуманы для машин. С таблицами Excel агенты сейчас работают неплохо, но путаются заметно чаще. Если данные готовите вы — готовьте их в машиночитаемом виде, а конвертацией в человеческий вид агент займётся сам.
Скилл, который прожаривает ваш запрос
Хорошая работа с агентом начинается не с того, что вы вываливаете на него контекст, а с того, что он вытягивает контекст из вас. У меня для этого есть скилл, который прожаривает запрос: вместо того чтобы сразу бросаться выполнять, агент задаёт неудобные вопросы — и по ходу разговора вы сами формулируете, что именно и зачем собираетесь сделать. Рекомендую включать его перед любой сколько-нибудь серьёзной задачей.
Вопрос из чата. Как он называется и где его взять? Это grill-me из набора Мэтта Покока — вообще хороший пакет скиллов. Там есть тонкость, на которую в чате сразу наткнулись: сам файл почти пустой, потому что он ссылается на второй скилл, grilling, из того же набора, — ставить нужно оба. Проще всего отдать агенту ссылку на весь пакет и попросить поставить то, что нужно. У Якова есть свой скилл под ту же задачу — miracle-unstuck.
Почему HTML, а не PowerPoint
Дашборд агент собрал в виде веб-страницы, и это не случайность. Презентации и текстовые документы — довольно неповоротливые форматы, придуманные под ограниченное человеческое внимание. Страница гибче, адаптивнее и умеет быть интерактивной, а размечать её на HTML (языке разметки веб-страниц) и оформлять на CSS (языке описания стилей — шрифтов, цветов, расположения блоков) для модели просто. Мы поэтому и презентации всё чаще делаем в виде страниц.
Практическая выгода тоже есть. Такую страницу можно отдать коллеге вместе с возможностью подставить свой файл данных: если структура совпадает, получится универсальная витрина. А можно повесить на неё кнопку, которая выгружает выводы отдельным файлом, чтобы результат не остался запертым внутри HTML.
Вопрос из чата. Обновится ли дашборд сам, если поменяется исходный файл с данными? Да, так можно: агент допишет к странице программу на JavaScript, которая подтянет свежий файл, а при необходимости поднимет и небольшой сервер, чтобы файл откуда-то брался. Звучит страшно, но поднимаете сервер не вы — всё это делает агент.
Кейс 2: конкурентный анализ мультиагентным workflow
Второй кейс показывал Яков. Это мультиагентный рабочий процесс (multi-agent workflow) — заранее описанная цепочка шагов, которую выполняют несколько агентов с разными ролями, часть из них параллельно. Запускается всё одной командой: название процесса плюс название бренда, который надо разобрать. Дальше без участия человека собирается полноценный кабинетный отчёт по конкуренту. Внутри скилла лежит файл на JavaScript, где детерминированно прописано, какой агент в какой момент вызывается, зачем, к какому программному интерфейсу обращается и чего от него ждут.
Что такое скилл
Скилл — это переиспользуемая инфраструктура агента, устроенная просто: папка и файл SKILL.md внутри. Комбинация обязательная, потому что именно по ней агент детерминированно, без всяких догадок, опознаёт скилл. Рядом, в той же папке, может лежать что угодно — справочные материалы, куски кода, правила, базы данных.
По сути скилл — это инструкция, в которую вы переписали то, что знаете как эксперт: как вести интервью, чем хорошее интервью отличается от плохого, как оформлять отчёт. Часть нашего профессионального знания не формализуется, но заметная часть — вполне.
Вопросы из чата. Скилл — это несколько агентов под руководством одного? Нет, это текст с инструкцией, внутри которого может быть написано, что по ходу дела нужно вызвать несколько агентов подряд. Где брать готовые? В открытых наборах Anthropic и OpenAI, на маркетплейсах вроде skills.sh; хорошие обычно всплывают в профильных пабликах и у активных участников сообщества — за ними полезно следить. Как писать свои? Главные скиллы стоит писать самим, потому что они про ваше доменное знание, но руками размечать файл не нужно: просто попросите агента написать скилл — формат он знает, а если хочется аккуратнее, есть отдельный скилл-конструктор. Дальше обязательно прогоняете результат несколько раз, смотрите, что сломалось, и правите. Я обычно пишу скилл после удачно сделанной задачи, когда понимаю, что её придётся повторять.
Шесть параллельных ресерчеров и оркестратор
Устроен процесс так. Сначала агент готовит себе папку. Потом запускает шесть параллельных агентов-исследователей (ресёрчеров), которые ничего не знают друг о друге: один собирает материалы в открытом вебе, другой идёт в репозитории с кодом, третий смотрит тарифы. Над ними стоит агент-оркестратор, дирижёр всего процесса: он ждёт, пока каждый закончит. Параллельность здесь не только про скорость: агенты не забивают друг другу контекстное окно, то есть объём текста, который модель удерживает за один раз, и каждый смотрит ровно то, что нужно ему. Единственное, что от них требуется, — оставить небольшой документ, который можно передать дальше.
На следующем этапе подключаются трое: аналитик, стратег и тот, кто подсвечивает риски. Каждый смотрит на собранную фактуру через свою линзу. На работу предыдущих агентов они уже не влияют — просто читают шесть готовых файлов и пишут свою записку. Когда все три записки готовы, появляется агент-райтер (writer) и собирает из них черновик отчёта по заданной структуре.
Вопрос из чата. Можно ли получить артефакты этого разбора, чтобы повторить его у себя? Яков выложил скилл целиком — multi-agent-research-skill, внутри лежат и готовый отчёт, и разбор процесса по шагам. Брать его и пользоваться как есть смысла мало: полезнее посмотреть, как он устроен внутри, и пересобрать под свою задачу.
Триангуляция: проверка каждого утверждения
Самое важное происходит перед тем, как отчёт кому-то показать. Из черновика вытаскиваются ключевые утверждения, и на каждое отдельно запускаются агенты, которые подтверждают его по нескольким независимым источникам — это и есть триангуляция. Проверяется, что перед нами не мнение и не прогноз, а факт, и что источники заслуживают доверия. Утверждения, которые не проходят внутренние критерии приёмки, в отчёт не попадают.
Критерии приёмки — это ровно то место, где нужен профессионал в предметной области. Формулируете их вы, а дальше проверку выполняет отлаженный скилл, который вы уже гоняли на других проектах и потому знаете, чего от него ждать.
Выигрывают те, кто оцифровал свои знания
Дальше это выходит за рамки личной продуктивности. Скиллы можно завести общими на команду: написали скилл обработки интервью — и агенты всех коллег делают эту работу так, как вы договорились. Придумали новую практику — обновили скилл в общем репозитории, и она разъехалась по всей команде.
Есть и обратная сторона. Когда скиллов накапливается сотня, они забивают память, вызываются хаотично и начинают мешать друг другу. Часть скиллов вообще ухудшает работу, потому что агент и без них справляется. Писать стоит те, что связаны с доменным знанием, то есть со знанием вашей предметной области, — с тем, чего модель про вашу работу знать не может.
Кейс 3: сервис мониторинга новостей
Третий кейс Яков собрал специально к эфиру — накануне вечером, с нуля, чтобы проверить расхожие возражения: что до конца так ничего и не построишь, что это долго и всё разваливается, что получится «как нагенерит».
Задача была такая: сервис, который следит за новостями по рабочему стеку — набору инструментов и технологий, с которыми работаешь. Каналов в мессенджере семьдесят, в них мнения, споры и слухи, а нужны сигналы. Начал Яков с двух документов. Первый — подробное описание продукта, где расписаны рамки: что входит в задачу и что в неё не входит, как собираются и обрабатываются данные. Второй — отдельная инструкция для агента: на каких моделях что делать, где экономить, какие прогоны и когда запускать. Дальше — планирование разработки и сборка.
Вопрос из чата. Первый документ пишется руками? Не совсем: у нас есть инструкция, которая задаёт форму и сама задаёт вам вопросы, — контекст даёте вы, а упаковывает всё это агент.
Через пятнадцать часов, из которых семь он спал, получился работающий продукт. Внутри видно каждый прогон: собрали сто семь инфоповодов, после снятия дубликатов осталось восемьдесят три, после отбора по релевантности — пятьдесят, до публикации дошёл сорок один сигнал. Результат приходит в мессенджер, а заодно есть настольное приложение для macOS. Всё шло через систему контроля версий, так что любой шаг, на котором агент что-то ломал, можно было откатить.
Агент как создатель переиспользуемой инфраструктуры
Этот кейс отличается от предыдущего принципиально, и различие стоит держать в голове с самого начала работы. В одном случае агент — это сотрудник: он сам выполняет работу, каждый раз заново. В другом случае агент — разработчик: он собирает вам сервис, внутри которого моделей может не быть вовсе, но без агента вы такое не построили бы.
Разработчиком при этом становиться не нужно. Нужно понимать логику и архитектуру настолько, чтобы следить за происходящим и натравливать на результат проверяющих агентов. Мы шутили, что продакт-менеджеры всегда были вайбкодерами (vibe coding — это когда программу создают, описывая словами, что должно получиться, а код пишет модель): они и раньше приходили к команде разработки и говорили, что нужно сделать. Теперь команда разработки — это агенты, а от вас по-прежнему требуются контекст, постановка задачи и приёмка. Только теперь всё это дешевле и намного быстрее.
Кейс 4: тематическое кодирование отзывов
Четвёртый кейс — про тематическое кодирование (thematic coding), то есть про разметку массива текстов по заранее заданным категориям. А заодно про то, чем агенты особенно хороши: они соединяют детерминированное программирование, где работает точный алгоритм, и вероятностную работу модели, где на один и тот же вопрос ответ каждый раз получается немного разным. Важно понимать, что из этого где уместно.
Берём сто отзывов о сервисе доставки, написанных живыми людьми — с большой буквы и с маленькой, с упоминанием бренда и без. Дальше вырабатываем схему разметки, то есть решаем, какие признаки мы будем присваивать каждому отзыву: тональность, тема, тип обращения (жалоба, сообщение об ошибке или предложение), наша уверенность в такой трактовке и, наконец, о ком вообще речь — о нас или о конкуренте. Схему задаёте вы; агент может предложить свой вариант, но решать лучше вместе с ним. Результат он складывает в JSON. Заодно он сам ведёт словарь названий: одно и то же имя сервиса люди пишут пятью способами, и там, где обычный скрипт спасует, модель справляется.
Поверх размеченного массива собирается дашборд: сколько отзывов позитивных и негативных, какие встречаются типы обращений, все жалобы на нас, все жалобы на конкурентов, всё сказанное про цену. А сверх того — дашборд решений, где к каждой проблеме подтянуты доказательства из отзывов и добавлены идеи, что с этим делать: часть предложил агент, часть вы дописали руками после обсуждения с командой. Так исследование не остаётся исследованием, а доводится до действий.
Формат результата агенту, в общем, безразличен: тот же дашборд он соберёт в видеоролик с ключевыми выводами, добавит музыку и картинки.
Вопрос из чата. А смонтировать видео он может — например, собрать задорный клип из того, что наснимали на телефоны на корпоративном мероприятии? Тут нужна другая модель, которая занимается распознаванием видео, и настраивать её придётся точнее. Модели, вырезающие «э-э» и нарезающие вертикальные ролики из лекций, уже есть, а вот по-настоящему креативный монтаж им пока не даётся.
С интервью всё устроено так же, только методологию приходится ставить аккуратнее: сначала вы вместе с моделью кодируете одно интервью, даёте развёрнутую обратную связь — что точно, а что мимо, — модель заводит из этого лист правил, и только после этого процесс масштабируется. Дальше вопрос уже только в токенах — кусочках текста, из которых складывается объём работы модели и её стоимость.
Лендинг вместо документации
Полезная привычка, к которой мы пришли: когда разобрались в новой теме, просим агента собрать объясняющую страницу, лендинг: как всё это работает, из каких шагов состоит, сколько стоило бы делать то же самое напрямую через программный интерфейс вместо агента, какие вопросы остались открытыми. Получается документация, с которой можно прийти к команде и рассказать, как всё было сделано.
Сам бы я писал такой документ два дня и, честно говоря, всё равно не собрал бы — знаний не хватило бы. Агент собирает его за один заход.
Итог: принципы важнее кейсов
За кадром осталось много — дизайн, работа с базами данных, кодирование интервью целиком. Но кейсы устаревают, а принципы остаются, и принципов в этом эфире три. Агенты автономны, и эту автономность нужно настраивать осознанно. Результат по-прежнему сильно зависит от оператора: если агент выдал ерунду, чаще всего это значит, что вы поленились дать ему контекст. И почти всё определяют инструменты, которые вы ему даёте, — не пустив повара на кухню, глупо ждать ужина.
Вход в агентов и правда непростой. Разобраться самостоятельно можно, но заметно медленнее, поэтому лучше быть среди людей, которые это постоянно обсуждают. И не рассчитывайте настроить агента под задачу с первого раза и закрыть ноутбук: это всегда маленькие шаги, которые складываются в большое.
Вопросы из чата. Сколько нужно, чтобы перейти на такой способ работы, и не выгораешь ли от постоянной жизни на пару этажей выше по абстракции? По моему опыту, вкатиться можно за две-три недели плотной работы, а детали набираются через проекты — это ещё месяц-три. Про усталость честно ответил Яков: работать он стал больше, чем раньше, — просто потому, что нравится больше.
Всё, о чём я здесь рассказываю, мы пробуем руками в Agentic Lab — от первой папки и первого скилла до собственных многоагентных процессов с проверкой фактов. Если хочется не просто послушать, а самому попробовать, приходите.
Полезные ссылки
Во время эфира мы накидали в чат много всего — здесь это собрано в одном месте.
Скиллы
- Набор скиллов Anthropic и набор скиллов OpenAI — официальные, с них удобно начинать.
- skills.sh — маркетплейс скиллов сообщества.
- grill-me — тот самый скилл, который прожаривает ваш запрос вопросами. Не забудьте поставить и
grillingиз того же набора. - miracle-unstuck — скилл Якова для той же задачи: помогает сформулировать то, что вы пока не можете сформулировать.
- multi-agent-research-skill — мультиагентный конкурентный анализ из второго кейса, целиком. Внутри есть готовый отчёт и разбор процесса по шагам.
Инструменты, которые стоит дать агенту
- Exa и Tabstack — поиск и чтение страниц, заточенные под агентов. Ищут заметно лучше встроенного поиска, подключать советуем всем.
- OpenRouter — ключи к моделям разных вендоров в одном месте. Полезно, когда нужного умения у вашей модели нет: Claude, например, не рисует картинки, а с ключом к чужой модели — нарисует. Пополняется иностранной картой; из российских агрегаторов есть, например, Polza.
- Vercel — бесплатный хостинг, на который агент сам опубликует собранный сайт или дашборд.
- status.claude.com — когда агент внезапно перестал отвечать, сначала проверьте здесь. У нас на эфире он действительно лёг, и не только у нас.
Голосовой ввод и расшифровка
- Wispr Flow — то, чем я наговариваю задачи агенту. По этой ссылке даётся бесплатный месяц.
- Handy и FluidVoice — бесплатные аналоги с открытым кодом, работают на локальных моделях и не отправляют голос в облако.
- Keyboop — переключатель раскладки, в котором заодно есть надиктовка.
- Stenographer — локальная расшифровка интервью и записей, программа моего знакомого. Работает на компьютере, ничего никуда не отправляет.
Где следить за нами
- Мой канал — анонсы эфиров и лаборатории. Там же лежит инструкция, как вкатиться в твиттер: основные люди сообщества сидят там, а внутри есть ссылки и на телеграм-каналы.
- Канал Якова и его GitHub.
- Предыдущий эфир — про будущее профессии исследователя, про который тоже спрашивали в чате.