Перейти к основному содержанию
Обложка: Harness: почему обвязка важнее самой AI-модели
ИИ-гайды

Harness: почему обвязка важнее самой AI-модели

📅 Обновлено: июнь 2026
💡 О чём гайд
Harness — это набор правил, инструментов, памяти, проверок и циклов, оборачивающих AI-модель и превращающих её из текстового процессора в автономного агента. Одна и та же модель в разных харнесах показывает разницу в результативности в десятки раз: с 6,7% до 68% решённых задач. Инженерия харнесов (Harness Engineering) стала новой парадигмой в 2025 году, вытеснив промт-инжиниринг и контекст-инжиниринг.
📢 Больше разборов — в канале «ИИ для чайников»

Самое большое собрание ИИ-гайдов в рунете

Каждый день — новый разбор. Забирай полностью и применяй.

Одна модель в разных харнесах: 6,7% → 68% качества (разница 10x)
Смена харнеса без смены модели: +7,7 п.п. качества, −4x токены (Stanford, март 2026)
Улучшение промта: <3% прироста; изменение харнеса: десятки процентов
Claude Code: 60% кода — логика модели, 40% — логика харнеса
Стоимость Anthropic: соло-агент $9/20 мин vs полный харнес (3 агента) $200/6ч

Что такое Harness?

Harness (англ. «упряжь») — это метафора для всей инфраструктуры, которая направляет и усиливает AI-модель. Модель (Claude, GPT, Gemini) — это мощная, но безвольная «лошадь». Сама по себе она лишь генерирует текст, без всякого понимания контекста, целей и результатов.

Harness — это «упряжка», которая включает:

  • Цикл агента — агент принимает решение, харнес выполняет инструменты, возвращает результат
  • Инструменты (Tools) — доступ к терминалу, файлам, Git, веб-поиску, API
  • Субагенты — параллельные помощники с отдельными контекстами
  • Правила, проверки, долгая память (long-term storage), интеграции (MCP)
  • Песочница (sandbox) и система разрешений (permissions)

Без харнеса модель бесполезна для сложных задач — она просто пишет текст в соответствии с запросом. С харнесом — это автономный работник, который может разбивать задачу на шаги, использовать инструменты, учиться из собственных ошибок и отчитываться о результатах.

Пример: В Claude AI (веб-чат) и Claude Code (CLI) используется одна и та же модель, но разный харнес. В чате она генерирует текст и отвечает на вопросы. А в Code — планирует работу, пишет код, запускает тесты, читает логи ошибок, исправляет баги и создаёт коммиты Git.

Важно: Модель — это только 40% решения. Остальные 60% — это архитектура харнеса.
Claude AI интерфейс

Три парадигмы работы с AI

Развитие технологий взаимодействия с AI-моделями прошло через три чётко разграниченные фазы:

1. Эра промт-инжиниринга (2023–2024)

Основной инструмент — тщательное составление запросов (промтов) для моделей с ограниченным контекстом (примерно 4 тысячи токенов). Успех целиком зависел от качества формулировки: правильный тон, структура, примеры (few-shot), и модель давала правильный ответ. Это была эра «волшебных слов».

2. Эра контекст-инжиниринга (2024–2025)

С ростом контекстного окна (до 1 миллиона токенов) появились новые методы: RAG (Retrieval-Augmented Generation), MCP (Model Context Protocol), динамические вызовы инструментов. Казалось, что проблему решили: закидываем всю документацию в контекст и получаем правильные ответы.

Но появилась новая проблема — «гниение контекста» (context rot): чем больше информации загружено в окно, тем ниже качество ответов модели. Резко увеличивается вероятность ошибок, противоречивых выводов, игнорирования важных деталей.

3. Парадигма инженерии харнесов (с 2025)

Фокус кардинально сместился с размера контекста на архитектуру инфраструктуры вокруг модели. Вместо наращивания контекста используются свежие данные на каждом шаге, чёткие правила обработки, внешние проверки и система инструментов. Цикл агента может запросить ровно то, что нужно, когда это нужно.

Этот подход решает проблемы предыдущих парадигм и обеспечивает масштабируемость. Это новая парадигма, которая определяет развитие отрасли на годы вперёд.

Три парадигмы работы с AI

Цифры: как Harness меняет результаты

  1. Эксперимент (февраль 2026): Одна модель (Grok Coder Fast) с разными форматами харнеса показала результат 6,7% против 68% решённых задач — разница в 10 раз.
  2. Исследование Stanford (март 2026): Смена харнеса (без смены модели) дала +7,7 процентных пункта качества, в 4 раза меньше израсходованных токенов и +4,7 п.п. точности на сложных задачах.
  3. Промт vs. Harness: В реальных проектах улучшение промта даёт менее 3% прироста. Изменение харнеса — десятки процентов.
  4. Пропорции в Claude Code: 60% кода — это логика модели (её обучение и веса), 40% — это логика харнеса (цикл, инструменты, проверки).
  5. Компромисс Anthropic: Соло-агент на 20 минут стоит $9. Полный харнес с тремя субагентами на 6 часов стоит $200. Дороже в 20 раз, но качество лучше на порядок.
Вывод аналитика Акаша Гупты (январь 2026): «Модель — это товар (commodity), как пшеница или нефть. А Harness — это ров вокруг крепости (moat), ваше конкурентное преимущество».
Цифры: как Harness меняет результаты

Готовые решения: рынок харнесов 2026

На рынке сложилось примерно 7 основных категорий готовых харнесов, каждый для своих целей:

Решение Тип Особенность Для кого
Claude Code & SDK (Anthropic) Готовый (API) Отполированный из коробки, Dynamic Workflows, поддержка Anthropic-моделей и любых через API Разработчикам, тем кто пишет код
Cursor (Anycode) Готовый (IDE) Вшит в редактор, собственные модели (Composer, Tab), PR-ревьюер, подключает весь репозиторий Разработчикам в IDE, 50%+ Fortune 500
Devin (Cognition) Готовый (облако) Полный автономный агент, браузер, песочница, ICU-биллинг, работает без вмешательства Менеджерам, техлидам для делегирования
OpenAI Codex Готовый (клиент) Готовая альтернатива Claude Code от OpenAI, 82K→14,5M пользователей за год Тем кто в стеке OpenAI
Google Antigravity (ADK) Готовый (облако) IDE + фреймворк, мультиагентная оркестрация, встроенный браузер, Google Cloud-интеграция Крупному корпоративному бизнесу
LangGraph Конструктор (граф) Open-source, собирайте свой харнес графом (ноды-шаги, рёбра-условия), Python Разработчикам под специфичные бизнес-задачи
CrewAI / AutoGen / AI2 Мультиагентные фреймворки Агенты-роли общаются между собой, компаундинг ошибок с глубиной цепи Исследователям, экспериментаторам
Готовые решения: рынок харнесов 2026

Детальный разбор топ-7 харнесов

1. Claude Code & Claude Agent SDK (Anthropic)

Где используется: Терминал, десктоп-приложение, VS Code, веб-версия.

Суть: Готовый, отполированный харнес «из коробки» вокруг моделей Anthropic (и любых через Claude API).

Что внутри: Цикл агента, инструменты (bash, поиск, чтение файлов), субагенты с изолированным контекстом, хуки (автопроверки перед коммитом), файл `.claude/CLAUDE.md` для долгой памяти, MCP-серверы, система разрешений и sandbox.

Фишка (май 2026): Dynamic Workflows — сам Claude пишет JavaScript-оркестрацию для задачи, запуская сотни субагентов параллельно и управляя ими.

Кому: Разработчикам и всем, кто хочет, чтобы AI писал код автономно. Самый отшлифованный и интегрированный вариант.

2. OpenAI Codex

Где используется: Терминал, VS Code, веб, macOS, iOS. Единый Codex App Server.

Суть: Альтернатива Claude Code от OpenAI для своей экосистемы.

Рост: С 82 тысяч скачиваний (апрель 2025) до 14,5 миллионов (март 2026).

Особенность: Модели OpenAI обучены на patch-формате (стиль git diff), а Anthropic — на string replace. Нельзя переключать модели в середине задачи (происходит падение качества).

Кому: Тем, кто уже в стеке OpenAI и хочет один счёт, один интерфейс и одного провайдера.

3. Cursor (Anycode)

Где используется: Собственная IDE (на базе VS Code) + Cursor Agent CLI.

Суть: Harness, вшитый в ядро редактора. Не подключается к вашей среде — вы переходите на новый редактор.

Что внутри: Полная индексация всего репозитория, Cloud Agents (работают в облаке Cursor), параллельные сессии, интеграции со Slack и GitHub.

Фишки: Собственные модели Cursor (Composer 2.5 для многофайловых правок, Cursor Tab для предсказания действий в редакторе, Backbot — AI-ревьюер PR и pull requests).

Кому: Разработчикам, которые предпочитают работать внутри IDE, а не в терминале. Доверяют более 50% компаний из Fortune 500.

4. Devin (Cognition)

Где используется: Полностью облачный автономный агент + десктопная IDE (Windsurf).

Суть: Harness для полного делегирования задач. Даёте задачу — уходите и работаете с чем-то другим — получаете готовый PR. Рассчитан на автономную работу без вашего участия.

Что внутри: Автономный цикл (agent loop), персональная песочница под каждую задачу, встроенный браузер, планировщик, ICU (billing unit).

Цена: Дорого (сотни долларов в месяц при активной работе).

Кому: Менеджерам, техлидам, стартапам для делегирования больших, чётко сформулированных задач (кодовые миграции, написание тестов, документирование). Не для точечного кодинга и текущих правок.

5. Google Antigravity & Agent Development Kit (ADK)

Где используется: Google Cloud + Gemini-модели.

Суть: Antigravity — готовый агентский IDE (аналог Cursor для Google). ADK — open-source фреймворк для сборки своих агентов на платформе Google Cloud.

Что внутри (Antigravity 2.0): Мультиагентная оркестрация (Planner, Executor, Verifier), встроенный браузер (Chromium), динамические субагенты, фоновые задачи, глубокая интеграция с Google Cloud (BigQuery, Vertex AI).

Кому: Крупному корпоративному бизнесу, уже сидящему на Google Cloud (банки, ритейл, телеком, страховки).

6. LangGraph

Где используется: Ваш собственный сервер, ваш код.

Суть: Конструктор для сборки своего харнеса, а не готовый продукт. Часть экосистемы LangChain.

Модель: Графовая архитектура (ноды — это шаги, рёбра — условия переходов). Python-based.

Что можно собрать: Сложные циклы с ветвлениями, параллельное выполнение, чекпоинты состояния, human-in-the-loop для критичных решений.

Кому: Разработчикам, которые строят кастомных агентов под специфичные бизнес-задачи (чат-боты, интеграции с CRM и ERP), когда готовые решения не подходят или требуют адаптации.

7. CrewAI / Autogen / AI2

Где используется: Ваш сервер.

Суть: Мультиагентные фреймворки, где агенты с разными ролями (PM, инженер, дизайнер, аналитик) общаются между собой и решают задачу через диалог.

Проблема: Компаундинг ошибок по цепи. Если каждый агент надёжен на 95%, то цепочка из пяти агентов будет надёжна лишь на примерно 77%. Точность падает с ростом глубины цепи и количества агентов.

Кому: В основном исследователям и экспериментаторам, которые изучают мультиагентные системы. Для 90% бизнес-задач один хорошо настроенный агент с инструментами работает лучше и надёжнее.

Будущее: адаптивные харнесы 2027

В 2027 году ожидается переход к динамическим (адаптивным) харнесам, которые агенты будут создавать под конкретную задачу на лету. Вместо статичной конфигурации харнеса система будет адаптивно строить нужную «упряжку» в зависимости от характера работы и контекста.

Примеры адаптации:

  • Для кодовой задачи — подключить инструменты Git, терминал, тестовый фреймворк
  • Для аналитики — подключить доступ к БД, встроить субагентов для параллельных запросов
  • Для коммуникации — добавить браузер, интеграцию с Slack/Email
  • Для сложной задачи — автоматически спавнить специализированных субагентов
Совет: Сегодня выбирайте готовый харнес под вашу категорию задач. Завтра харнес будет выбирать сам себя за вас.

Инженерия харнесов — это не тренд на год, это парадигма на годы вперёд. Вложения в архитектуру инфраструктуры окупятся в десятки раз.

Понравился разбор?

В канале «ИИ для чайников» — новый гайд каждый день

Перейти в канал

В 2026 году модель — это товар (commodity), как пшеница или нефть. Конкурентное преимущество — это харнес вокруг модели, его архитектура, инструменты и правила. Инженерия харнесов (Harness Engineering) вытеснила промт-инжиниринг, и это тренд на годы вперёд.

Часто задаваемые вопросы

Гайд объясняет, что Harness (инфраструктура вокруг AI-модели) важнее самой модели. Одна и та же модель в разных харнесах показывает разницу в результативности в десятки раз, а смена харнеса без смены модели даёт +7,7 п.п. качества. Инженерия харнесов стала новой парадигмой в 2025–2026 году.
Применение зависит от вашей роли. Разработчикам: используйте Claude Code, Cursor или Devin для автоматизации кода. Техлидам: делегируйте задачи через Devin или LangGraph, чтобы агент работал независимо. Аналитикам: собирайте кастомных агентов на LangGraph под специфичные процессы (CRM, интеграции). Итог: выберите готовый харнес (если он подходит) или соберите свой под задачу.
Результат: одна модель в разных харнесах — 6,7% → 68% решённых задач (10× улучшение). Смена харнеса (без смены модели) — +7,7 п.п. качества, −4× токены, +4,7 п.п. точности. Улучшение промта даёт <3% прироста, изменение харнеса — десятки процентов.

Скачать гайд

Полная версия с примерами и подробными инструкциями.

📢 ИИ для чайников