Все посты серии

Пост 6 из 8

Что нужно, чтобы иметь своего AI-агента

Семь составляющих работающего агента: модель, харнесс, инструменты, контекст, проверки, права и бюджет. Что из этого можно взять готовым, что придётся делать своими руками и сколько это стоит в токенах.

Александр Михалькевич · Проверено 5 октября 2026 · 4 мин чтения

Что нужно для своего агента
Агент — это не только модель: Модель → Харнесс → Инструменты и MCP → Контекст → Проверки
1. Харнесс: готовый или свой
2. Контекст: меньше, но точнее
3. Проверки: 20–50 задач
4. Бюджет: считай токены
Минимальный набор: Доступ к модели: подписка или API-ключ; Харнесс: Claude Code, Codex или Cursor; Файл инструкций и команда проверки; Правила прав: что разрешено и что запрещено; Набор задач, чтобы мерить качество; Лимит бюджета и просмотр логов работы
Подробно — на сайте
Слайд 1 из 8

«Хочу своего агента» обычно значит одно из двух: агент, который помогает вам работать с кодом и документами, или агент внутри вашего продукта, который работает с клиентами и данными. Состав у них одинаковый, разница в том, что берётся готовым. Ниже — семь составляющих и минимальный набор для старта.

1. Модель

Модель рассуждает и выбирает следующее действие. Доступ — по подписке или API. Для Claude Code нужна подписка Pro, Max, Team, Enterprise или аккаунт Console; бесплатный план claude.ai доступа не даёт. Можно работать и через облачных провайдеров (Amazon Bedrock, Google Cloud, Microsoft Foundry).

По данным обзора моделей, у Claude Fable 5.1, Opus 5.5 и Sonnet 5.5 контекстное окно — 1 млн токенов, у Haiku 4.5 — 200 тыс. Большое окно не повод загружать в него всё подряд, об этом ниже.

2. Харнесс

Харнесс — обвязка вокруг модели: цикл «собрать контекст → действовать → проверить», инструменты, управление контекстом и права. В документации Claude Code сказано прямо: Claude Code — это харнесс, Claude — модель внутри него.

  • Готовый харнесс — Claude Code, Codex, Cursor. Подходит для работы с кодом, документами, данными на вашей машине или в облаке.
  • Свой харнесс — на Claude Agent SDK (Python и TypeScript; тот же движок, что у Claude Code) или на OpenAI Agents SDK. Нужен, когда агент встраивается в продукт: свой интерфейс, свои инструменты, свои правила.

Совет Anthropic из Building effective agents: начинайте с API напрямую и простых паттернов. Фреймворки ускоряют старт, но прячут промпты и ответы, и отлаживать становится труднее.

3. Инструменты

Без инструментов модель только отвечает текстом. Базовый набор агента — чтение и правка файлов, поиск, терминал, веб. Всё остальное подключается через MCP: трекер задач, база данных, браузер, мониторинг ошибок. Подробнее о подключённом стеке — в седьмом посте.

Если инструменты пишете вы, пригодятся выводы статьи Anthropic Writing effective tools for agents:

  • Меньше, но лучше. Больше инструментов не значит лучше. Один schedule_event полезнее связки list_users + list_events + create_event.
  • Понятные имена с префиксами, например asana_search и jira_search, чтобы агент не путал похожие инструменты.
  • Осмысленный ответ. Человекочитаемые имена вместо UUID, пагинация и фильтры, понятные сообщения об ошибках.
  • Описание инструмента — это промпт. Небольшие правки описаний дают заметный прирост качества.

4. Контекст

Контекст — всё, что модель видит в момент решения: системный промпт, инструкции, описания инструментов, история, результаты вызовов. Anthropic называет работу с ним контекст-инжинирингом: подобрать минимальный набор токенов с максимальной пользой.

Главная причина — деградация длинного контекста (context rot): у модели ограниченный «бюджет внимания», и каждый новый токен его расходует. Поэтому:

  • держите файл инструкций коротким и конкретным;
  • давайте агенту ссылки и инструменты поиска, а не всю базу знаний сразу. Anthropic называет это подгрузкой контекста «точно в срок» (just in time);
  • для длинных задач используйте компакцию, заметки во внешних файлах и сабагентов, которые возвращают только итог.

Если агент отвечает по вашим документам, это задача RAG: найти нужные фрагменты и подставить их в контекст во время запроса.

5. Проверки

Без проверок непонятно, работает агент или только выглядит работающим. Два уровня:

  • Проверка внутри задачи — тесты, сборка, линтер, которые агент запускает сам (петля проверки).
  • Проверка агента в целом — evals: набор задач с критериями успеха. По рекомендации Anthropic хватит 20–50 задач из реальных провалов. Оценивать их можно кодом (быстро и объективно), моделью-судьёй по рубрике (гибко) или человеком (точно, но дорого). Обязательно читайте транскрипты: без этого не понять, правильно ли работают сами проверки.

6. Права и песочница

Принцип минимальных прав: агент получает только те инструменты и доступы, которые нужны для задачи. OWASP относит избыточную автономию к десяти главным рискам LLM-приложений и советует ограничивать набор расширений, давать им минимальные права и требовать подтверждения человека для действий с последствиями.

На практике: правила deny для секретов и опасных команд, режим с подтверждениями для незнакомых проектов, песочница для shell-команд, отдельные токены с узкими правами для MCP-серверов.

7. Бюджет и наблюдаемость

Агенты дорогие. Anthropic в статье о своей исследовательской системе приводит цифры: агент тратит примерно в 4 раза больше токенов, чем чат, мультиагентная система — около 15 раз. В их тесте объём потраченных токенов объяснял 80% разницы в качестве. Вывод простой: мультиагентная схема оправдана, только когда ценность задачи покрывает расходы.

Что настроить:

  • claude -p ... --output-format json возвращает total_cost_usd — это оценка на стороне клиента, она может отличаться от счёта;
  • в интерактивной сессии /context показывает, на что ушло контекстное окно;
  • транскрипты сессий хранятся локально, их стоит просматривать.

Минимальный набор для старта

  1. Подписка Claude или API-ключ.
  2. Claude Code, Codex или Cursor.
  3. CLAUDE.md или AGENTS.md до 200 строк и одна команда проверки.
  4. Правила прав: allow для безопасного, deny для секретов и git push.
  5. Десяток задач, на которых вы сравниваете результат.
  6. Лимит расходов и привычка смотреть, что агент делал.

Как это собрать по шагам, описано во втором посте.

Термины из поста

Где это отрабатывается

Источники

  1. Claude Code — How Claude Code works (агентный цикл и харнесс)
  2. Claude — Models overview
  3. Anthropic — Building effective agents
  4. Anthropic — Writing effective tools for agents
  5. Anthropic — Effective context engineering for AI agents
  6. Anthropic — Demystifying evals for AI agents
  7. Anthropic — How we built our multi-agent research system
  8. Claude Code — Run Claude Code programmatically
  9. OWASP — LLM06:2025 Excessive Agency
  10. Claude Agent SDK — overview
ПоделитьсяTelegramXLinkedIn

Отработайте это на практике

В симуляторах школы агент делает задачу, а вы учитесь ставить её, проверять результат и не доверять вслепую.

Открыть симуляторы