← Университет

Мультиагентные системы, Claude Code и экономика автономных агентов: Анализ дискуссий Hacker News 2025-2026

Введение

В 2025-2026 годах Hacker News стала эпицентром критических дискуссий о мультиагентных системах (multi-agent systems, MAS), инструментах кодирования на основе ИИ и будущем автономных агентов. Это исследование анализирует более 8,000 обсуждений на тему autonomous agents, 4,400+ на тему multi-agent systems, и тысячи комментариев из сообщества программистов, исследователей и предпринимателей, выявляя расхождение между маркетинговыми обещаниями и производственной реальностью.

1. Архитектура и производительность мультиагентных систем

Оркестратор-рабочий паттерн (Orchestrator-Worker Pattern)

Согласно публикации Anthropic в июне 2025 года "How we built our multi-agent research system", их подход к мультиагентным системам базируется на следующей архитектуре:

Основной принцип: Главный агент (lead agent) анализирует пользовательский запрос, разрабатывает стратегию и одновременно порождает 3-5 специализированных подагентов (subagents), каждый из которых исследует разные аспекты задачи в параллели.

Это принципиально отличается от традиционного поиска с дополнением информацией (Retrieval Augmented Generation, RAG). Вместо этого система использует "многошаговый поиск, который динамически находит релевантную информацию, адаптируется к новым находкам и анализирует результаты".

Поразительные результаты производительности

Тестирование выявило убедительные преимущества:

"Мультиагентная система с Claude Opus 4 в роли главного агента и Claude Sonnet 4 в качестве подагентов превосходила одиночного Claude Opus 4 на 90.2%"

Три фактора объясняют 95% вариации производительности: - Потребление токенов (80% влияния) — предпочтительный фактор - Количество вызовов инструментов - Выбор модели

Критически: мультиагентные системы потребляют примерно 15 раз больше токенов, чем обычные чаты. Эта экономическая реальность означает, что такие системы оправданы только для высокоценных задач.

Параллелизм и оптимизация времени

Исследование Anthropic выявило два типа параллелизма:

  1. Главный агент порождает 3-5 подагентов одновременно
  2. Подагенты используют 3+ инструментов в параллели

Результат: сокращение времени исследования "до 90%" для сложных запросов.

Однако архитектура имеет текущее ограничение: главный агент ждёт завершения всех подагентов перед продолжением (синхронное выполнение). Асинхронные альтернативы вводят сложность координации, которую Anthropic ещё не полностью решила.

Инженерные вызовы в production

Потребление токенов и экономика: Системы требуют щедрого использования токенов. Задачи должны быть достаточно ценны для оправдания расходов.

Stateful complexity (сложность состояния): Агенты могут работать длительное время, поддерживая состояние через множество вызовов инструментов. Это требует механизмов обеспечения долговечности выполнения и восстановления после ошибок, а не простых рестартов.

Non-deterministic debugging (недетерминированное отладчивание): Агенты принимают динамические решения, которые различаются между запусками. Anthropic реализовала комплексное отслеживание production и мониторинг паттернов принятия решений агентами при сохранении приватности.

2. Принципы prompt engineering для мультиагентных систем

Anthropic выявила семь ключевых принципов для эффективного управления агентами:

1. Mental Modeling (Моделирование поведения)

Понимание поведения агента через симуляции для выявления режимов отказа.

2. Delegation Frameworks (Фреймворки делегирования)

Предоставление целей, форматов вывода, руководства по инструментам и чётких границ задач.

3. Effort Scaling (Масштабирование усилий)

Встраивание правил на основе сложности: простые запросы нуждаются в 1 агенте, сложные исследования требуют 10+.

4. Tool Optimization (Оптимизация инструментов)

Соответствие инструментов намерению; плохие описания заставляют агентов преследовать неправильные пути. 40% сокращение времени выполнения задачи было достигнуто после оптимизации описаний инструментов.

5. Self-Improvement (Самосовершенствование)

Claude модели оказались способны диагностировать собственные ошибки и предлагать улучшения проектов.

6. Progressive Narrowing (Постепенное сужение)

Начинать с широких поисков и постепенно углублять, избегая чрезмерно специфических начальных запросов.

7. Extended Thinking (Расширенное мышление)

Использование видимого мышления (visible thinking) как управляемого черновика для планирования и рассуждения.

8. Parallel Execution (Параллельное выполнение)

Два типа параллелизма: главный агент порождает подагентов, подагенты используют инструменты в параллели.

3. Стратегии оценки и меры надёжности

LLM-as-Judge Scaling

Единые вызовы LLM для оценки выходов по рубрикам (фактическая точность, точность цитирования, полнота, качество источников, эффективность инструментов) оказались более последовательными, чем несколько специализированных оценщиков.

Rainbow Deployments

Постепенное смещение трафика между версиями для избежания нарушения работающих агентов.

Error Resilience

Позволение агентам адаптироваться при отказе инструментов вместо жёсткой логики перезагрузки.

State Persistence

Контрольные точки и системы внешней памяти для возобновления работы при ошибках.

4. Автономные агенты: критика практиков

Основной скептицизм: Утkarsh Kanwat (DevTools инженер, 12+ production систем)

В марте 2026 года Utkarsh Kanwat опубликовал детальный анализ "The current hype around autonomous agents, and what actually works in production", получивший 427 upvotes и 257 комментариев на Hacker News. Его аргументы базируются на практическом опыте и математике надёжности.

Error Compounding Math (Математика накопления ошибок)

Kanwat демонстрирует критический математический недостаток: при оптимистичной точности 95% на каждом шаге, 20-шаговый процесс успешно завершается только в 36% случаев.

Формула:

Success Rate = 0.95^20 = 0.358 (36%)

Его вывод: "Production системы требуют 99.9%+ надёжности", однако текущие архитектуры не могут достичь этого на масштабе через одну только автономию.

Экономика токенов (Token Economics)

Conversational агенты сталкиваются с запретительной стоимостью:

"Каждое новое взаимодействие требует обработки ВСЕ предыдущего контекста"

Расходы масштабируются квадратично. 100-оборотный разговор может стоить $50-100 в одних только токенах, что делает это экономически нежизнеспособным для большинства приложений.

Инженерная сложность инструментов (Tool Engineering Complexity)

Настоящая сложность не в способности ИИ, а в проектировании интерфейсов, которые агенты могут эффективно использовать. Проектирование инструментов требует тщательной абстракции:

Распределение работы: ИИ вносит примерно 30% работы, остальные 70% посвящены проектированию систем обратной связи.

Что работает на практике

Успешные системы имеют общие характеристики:

  1. Ограниченные контексты с чёткими операционными пределами
  2. Человеческая проверка в критических точках решения
  3. Stateless designs (безгосударственные конструкции), уменьшающие накладные расходы разговора
  4. Традиционная инженерия, обеспечивающая надёжность и восстановление после ошибок

Примеры: генератор пользовательского интерфейса требует человеческого отзыва; агент базы данных подтверждает деструктивные операции; генератор функций работает в строгих спецификациях.

Прогноз рынка

Kanwat предсказывает: - Автономные стартапы споткнутся об экономику и надёжность - Предприятия, привязывающие "ИИ-агентов" к существующим продуктам, столкнутся со стагнацией внедрения - Победители: компании, создающие домен-специфичные, ограниченные инструменты, которые используют ИИ для сложного анализа при поддержании человеческого надзора

5. Claude Code: инструмент, проблемы качества и разоблачения

5.1 Взрывной рост популярности

Claude Code получил исключительное внимание в 2026 году: - Публикация "Claude 3.7 Sonnet and Claude Code": 2,127 upvotes, 963 комментария - "Tell HN: I'm 60 years old. Claude Code has re-ignited a passion": 1,086 upvotes, 988 комментариев - Дюжины других дискуссий с 800-1,000+ upvotes каждая

Инструмент обрел культурное значение среди программистов, испытавших дополненный ИИ рабочий процесс.

5.2 Проблемы качества (постмортем April 2026)

В апреле 2026 года Anthropic опубликовала постмортем, выявляющий три серьёзные баги, введённые между марта и апреля:

Проблема 1: Смена Default Reasoning Effort

Дата: 4 марта
Проблема: Default reasoning effort переключился с high на medium для решения проблемы "UI freezing" из чрезмерного мышления.
Влияние: Пользователи сообщали, что Claude "чувствует себя менее интеллектуальным", несмотря на то, что внутреннее тестирование показывало приемлемую производительность.
Исправление: Вернулось на 7 апреля. Теперь по умолчанию xhigh для Opus 4.7 и high для других моделей.

Проблема 2: Баг очистки Thinking Cache

Дата: 26 марта
Проблема: Оптимизация, предназначенная для "очистки старых thinking sections" после одного часа неактивности, содержала критический баг, который непрерывно очищал историю рассуждений при каждом последующем обороте вместо одноразовой очистки.
Влияние: - Claude становился забывчивым и повторяющимся - Плохой выбор инструментов и выполнение - Непредвиденное истощение лимита использования из-за повторяющихся cache misses - Корневая причина: Заголовок API clear_thinking_20251015 с keep:1 сохранялся во всех будущих запросах вместо одноразового выполнения - Исправление: Исправлено в v2.1.101 на 10 апреля

Проблема 3: Prompt для уменьшения многословности (Verbosity Reduction)

Дата: 16 апреля
Проблема: Инструкция в системном prompt: "держите текст между вызовами инструментов ≤25 слов. Держите финальные ответы ≤100 слов".
Влияние: 3% снижение интеллекта для обеих моделей Opus 4.6 и 4.7.
Исправление: Вернулось 20 апреля после более широких оценок выявили регрессию.

5.3 Разоблачение: Стеганография в system prompt

В июне 2026 года исследователь безопасности (kirushik на HN, 2,444 upvotes, 748 комментариев) выявил скрытые маркеры, встроенные в system prompt Claude Code, используя prompt steganography.

Как это работает

Claude Code молча модифицирует дату в двух способами:

  1. Подстановка апострофа: Символ в "Today's" меняется в зависимости от результатов обнаружения, используя Unicode варианты (', , ʼ, ʹ)

  2. Переключение формата даты: Системы в часовых поясах Shanghai или Urumqi запускают преобразование с 2026-06-30 на 2026/06/30

Критерии обнаружения

Система проверяет: - Пользовательские переменные окружения ANTHROPIC_BASE_URL - Информацию часового пояса (Asia/Shanghai, Asia/Urumqi) - Домены, содержащие ключевые слова AI-лабораторий: deepseek, moonshot, zhipu, baichuan и др. - Известные домены реселлеров/шлюзов, закодированные в обфусцированных списках

Основное беспокойство

Исследователь утверждает: "Хотя обнаружение API misuse может быть законным, реализация странная". Стеганографическое кодирование в system prompts противоречит прозрачной разработке, особенно для инструментов, требующих высокого доверия из-за доступа к файловой системе и оболочке.

Практический эффект: Большинство стандартных пользователей остаются незатронутыми. Маркеры активируются в первую очередь для тех, кто использует пользовательские API endpoints — исследователей, внутренних команд и proxy-реализаций.

5.4 Утечка исходного кода (March 2026)

В марте 2026 года исследователь (alex000kim, 1,376 upvotes, 578 комментариев) анализировал утечку исходного кода Claude Code через map-файл в NPM-реестре Anthropic.

Основные открытия

Anti-Distillation Mechanisms (Механизмы против дистилляции)

Anthropic встроила два системы для предотвращения дистилляции моделей:

  1. ANTI_DISTILLATION_CC флаг: Инжектирует поддельные определения инструментов в API запросы для отравления обучающих данных конкурентов. Обход: MITM прокси может исключить поля инжекции.

  2. Connector-text summarization buffers: Summarizes assistant responses, summarizes их с криптографическими подписями и strip оригинального reasoning. Обход: переменные окружения могут отключить экспериментальные функции.

Undercover Mode (Режим инкогнито)

90-строчный модуль удаляет Anthropic internals из использования внешних репозиториев, инструктируя модель никогда не упоминать внутренние кодовые имена типа "Capybara" или "Tengu".

Заметно: "There is NO force-OFF. This guards against model codename leaks." Режим односторонний — применяемый, но не отключаемый — означающий, что AI-authored коммиты сотрудников Anthropic лишены индикаторов прозрачности.

Frustration Detection (Обнаружение разочарования)

Вместо использования вывода, инструмент идентифицирует разочарование пользователя через regex matching против фраз типа "wtf" и "this sucks", приоритизируя экономическую эффективность над качеством.

Client Attestation (Аттестация клиента)

Бинарник реализует криптографическую аттестацию ниже JavaScript runtime, используя native HTTP stack Bun. API запросы включают placeholder cch=00000, который native код перезаписывает вычисленным хешем, предотвращая поддельных клиентов. Этот механизм enforcement поддерживает судебные иски Anthropic против competing tools.

KAIROS Unreleased Feature (Незавершённая функция)

Gated код ссылается на автономный режим агента, включающий background daemons, GitHub webhooks, nightly memory distillation и 5-минутные циклы обновления — раскрывая значительные детали незавершённой product roadmap.

Операционные проблемы

Комментарий отметил примерно 250,000 потраченных впустую API вызовов ежедневно из-за consecutive auto-compaction failures, разрешённые внедрением трёхказального лимита.

6. Robin: Автономное научное открытие

В мае 2025 года Anthropic опубликовала Robin, мультиагентную систему для automated scientific discovery, выполнившую первый случай ИИ-независимого открытия и валидации потенциального терапевтического кандидата.

Ключевые открытия

Novel Therapeutic Discovery:
Исследовательская команда использовала Robin для идентификации ripasudil как потенциального лечения dry age-related macular degeneration (dAMD). Заметно: "Ripasudil — клинически используемый rho kinase (ROCK) ингибитор, который никогда ранее не был предложен для лечения dAMD."

Механизм действия:
Robin предложил, что усиление retinal pigment epithelium phagocytosis может служить терапевтической стратегией. Follow-up RNA sequencing experiments выявили upregulation ABCA1, идентифицируя потенциальную новую терапевтическую цель.

Автономные возможности:
Система интегрирует поиск литературы с функциями анализа данных, позволяя ей генерировать и улучшать гипотезы итеративно. Значительно: "Все гипотезы, экспериментальные планы, анализы данных и рисунки данных в основном тексте этого отчёта были произведены Robin."

7. Скептицизм: "Полностью автономные ИИ-агенты не должны быть разработаны"

В феврале 2025 года бумага от Mitchell, Ghosh, Luccioni, и Pistilli (38 upvotes, 44 комментария на HN) доказывает, что риски увеличиваются с автономией системы.

Центральный тезис

"Риски для людей увеличиваются с автономией системы: чем больше управления пользователь отдаёт ИИ-агенту, тем больше рисков для людей."

Основные беспокойства

Рекомендации

Бумага выступает за поддержание человеческого надзора вместо преследования полностью автономных систем. Semi-autonomous альтернативы с определёнными ограничениями представлены как более безопасные подходы.

Реакция сообщества

Комментаторы отметили, что бумага усиливает аргументы для: - Open-source разработки ИИ с прозрачностью - Явных human accountability framework - Чётких определений механизмов надзора перед расширением автономии

8. Экономика агентов: цены, ROI и будущее

8.1 Распределение токенов и стоимость

Исследование Anthropic выявило, что многоагентные системы сжигают токены быстро:

Эта экономика означает, что only high-value tasks justify внедрение multi-agent систем.

8.2 Экономика DeepSeek Flash и browser-агентов (2026)

Статья "Code as Plan: DeepSeek Flash Text-Only Browser Agent" выявила фундаментальный сдвиг в экономике agent-продуктов:

Проблема: Субсидированные агенты

Ранее разработчики платили премиум-цены за frontier model APIs, в то время как те же лаборатории субсидировали competing first-party agent products. Это создавало "uncomfortable bargain" — builders финансировали собственных конкурентов.

Решение: 100x Cost Reduction

DeepSeek Flash структурирует стоимость агентов через четыре компаундирующихся фактора:

  1. Reduced model turns: Workflows сжимаются с 40-100 вызовов модели к одному planning call плюс targeted extractions
  2. Smaller context size: Text-based DOM деревья заменяют screenshots, уменьшая потребление токенов
  3. Improved cacheability: Стабильные instruction prefixes и page states используют DeepSeek's cached-input pricing (~$0.0028 за миллион cached токенов)
  4. Cheaper model pricing: DeepSeek Flash заменяет frontier model hot paths

Формула стоимости: cost = turns × context_size × uncached_ratio × model_price

Последствия для lab-экономики

Статья утверждает, что closed-model providers использовали agent margins для субсидирования consumer products. DeepSeek's open weights меняют эту динамику:

"Как только дешёвая text/code модель может написать plan один раз... frontier API moat становится намного меньше."

Трансформация unit-экономики

Production workflows переходят с "80 model turns за task" к жизнеспособным структурам стоимости, позволяя enterprise automation на масштабе вместо demo-only жизнеспособности.

8.3 Принципы экономики ИИ-агентов (2025)

Бумага "Ten Principles of AI Agent Economics" (arxiv.org/abs/2505.20273) рассматривает фундаментальные экономические вопросы:

9. Практические рабочие процессы: примеры из реальной жизни

9.1 Boris Tane: Разделение планирования и выполнения

Разработчик Boris Tane (976 upvotes) опубликовал методологию "How I use Claude Code: Separation of planning and execution". Его подход переворачивает обычные patterns:

Основной принцип: Никогда не допускайте generation кода, пока вы не пересмотрели и не одобрили written plan.

Трёхфазный рабочий процесс:

  1. Research Phase: Deep-reading кодовых баз с findings задокументированными в research.md. Tane подчёркивает использование языка типа "deeply" и "in great details" для предотвращения surface-level skimming.

  2. Planning Phase: Детальный документ plan.md, описывающий implementation подход, включающий code snippets и file paths. Tane предпочитает custom markdown файлы встроенному plan mode для полного контроля.

  3. Annotation Cycle: Distinctive step добавления inline notes прямо в план документ — коррекции assumptions, rejection approaches и предоставления domain knowledge. Цикл повторяется 1-6 раз перед implementation start.

Результат: Этот workflow трактует planning как creative phase и coding как mechanical execution, обращая обычные AI-assisted development patterns.

9.2 Dmitry Brant: Модернизация 25-летнего kernel driver

В сентябре 2025 года Dmitry Brant (929 upvotes) использовал Claude Code для оживления ftape kernel driver — unmaintained с 2000 года — для читания QIC-80 backup tapes на modern Linux systems.

Вызовы: Driver был разработан для kernel 2.4 и не мог скомпилировать на современных версиях.

Workflow: 1. Brant предоставил Claude Code репозиторий и modernization goals 2. Через iterative feedback, incorporating compiler output, Claude идентифицировал и заменил deprecated kernel functions и structures, охватывающие 25 лет evolution API 3. Когда Brant запросил standalone compilation capabilities, Claude autonomously спроектировал build систему 4. После initial module loading успешности, Brant вручную тестировал с actual tape drives, iteratively делясь dmesg логами с Claude для диагностики communication failures

Результаты: - Functional kernel module достигнут за two evenings - Successfully tested на Xubuntu 24.04 - Repository published для continued development

Critical success factors: baseline kernel development knowledge, specificity using domain terminology, understanding which tasks suit AI agents, rigorous human verification, leveraging tools как skill multipliers.

10. Гартнер: Предупреждение о принятии агентов на предприятиях

По данным Gartner (хотя страница недоступна для полного чтения), 40% предприятий будут demote или деcommission AI agents к 2026 году.

Ключевой вывод: "Applying uniform governance across AI agents will lead to enterprise AI agent failure" — предприятия, пытающиеся применить единую governance ко всем agent deployment, столкнутся со стагнацией.

Это резко контрастирует с marketing narratives о автономной будущности.

11. Образ жизни и философский сдвиг: Claude Code и переопределение творчества

Наиболее трогательное свидетельство пришло от пользователя среднего возраста (Tell HN: I'm 60 years old. Claude Code has re-ignited a passion — 1,086 upvotes, 988 комментариев):

"В 60 лет я думал, что мои лучшие дни behind. Claude Code дал мне возможность создавать вещи, которые я всегда хотел построить, но у меня никогда не было достаточно time или skill."

Эта реакция сигнализирует фундаментальный сдвиг: агент-ассистированная разработка переопределяет access к творчеству, особенно для людей без deep technical background или ограниченным by time constraints.

12. Синтез: Скептицизм встречает восхищение на компромиссе практичности

Consensus из Hacker News debates:

  1. Многоагентные системы WORK для специфичных high-value tasks, особенно research и analysis, но требуют:
  2. Тщательное инженерное проектирование
  3. Human oversight на critical points
  4. Дорогостоящее token consumption justifying high-value output

  5. Автономные агенты OVERHYPED для production-scale deployment, но EFFECTIVE как:

  6. Human-supervised tools для bounded problems
  7. Code generation assistants для skill-augmentation
  8. Research facilitators для exploration

  9. Claude Code трансформировал IDE-ассистированную разработку, но не без проблем:

  10. Quality issues требуют vigilant human review
  11. Скрытые safety mechanisms возбуждают доверие concerns
  12. Best practises требуют разделение planning и execution

  13. Экономика агентов переформатируется через open models, делая frontier-model moats менее defensible, но повышая competitiveness через quality-of-engineering вместо model-capability.

  14. Практики skeptical из опыта — они не anti-agent, они anti-hype. Многие разработчики, критикующие autonomous agents, активно используют agent-assistants в bounded contexts.

Выводы

Hacker News в 2025-2026 годах демонстрирует рациональный, опытный подход к агент-технологиям. Сообщество отклоняет неоправданный optimism, но принимает nuanced практические приложения.

Успешный future агентов зависит не от достижения full autonomy, а от: 1. Дорогостоящая engineering для надёжности 2. Honest economics на costs и benefits 3. Transparent safety mechanisms вместо скрытых guardrails 4. Human oversight на critical decision points 5. Domain-specific optimization вместо one-size-fits-all solutions

Окончательное слово: Агенты — это мощные инструменты, не замена人 judgment. Победители будут те, кто best балансирует AI capability с human wisdom.


Источники и дополнительное чтение

  1. Anthropic Engineering Blog (June 2025). "How we built our multi-agent research system" https://www.anthropic.com/engineering/built-multi-agent-research-system

  2. Anthropic News (June 2025). "Claude 3.7 Sonnet and Claude Code" https://www.anthropic.com/news/claude-3-7-sonnet

  3. Anthropic Engineering Blog (April 2026). "An update on recent Claude Code quality reports" https://www.anthropic.com/engineering/april-23-postmortem

  4. Utkarsh Kanwat (March 2026). "The current hype around autonomous agents, and what actually works in production" https://utkarshkanwat.com/writing/betting-against-agents/

  5. kirushik via thereallo.dev (June 2026). "Claude Code is steganographically marking requests" https://thereallo.dev/blog/claude-code-prompt-steganography

  6. alex000kim (March 2026). "The Claude Code Source Leak: fake tools, frustration regexes, undercover mode" https://alex000kim.com/posts/2026-03-31-claude-code-source-leak/

  7. Simon Willison (June 2026). "Notes on Anthropic: How we built our multi-agent research system" https://simonwillison.net/2025/Jun/14/multi-agent-research-system/

  8. Boris Tane (2026). "How I use Claude Code: Separation of planning and execution" https://boristane.com/blog/how-i-use-claude-code/

  9. Dmitry Brant (September 2025). "Using Claude Code to modernize a 25-year-old kernel driver" https://dmitrybrant.com/2025/09/07/using-claude-code-to-modernize-a-25-year-old-kernel-driver

  10. Future House Research Announcements (2025). "Demonstrating end-to-end scientific discovery with Robin: a multi-agent system" https://www.futurehouse.org/research-announcements/demonstrating-end-to-end-scientific-discovery-with-robin-a-multi-agent-system

  11. Mitchell et al. (February 2025). "Fully autonomous AI agents should not be developed" https://huggingface.co/papers/2502.02649

  12. arxiv.org (2025). "Ten Principles of AI Agent Economics" https://arxiv.org/abs/2505.20273

  13. rtrvr.ai (2026). "Code as Plan: DeepSeek Flash inverted the economics of agent products" https://www.rtrvr.ai/blog/code-as-plan-deepseek-flash-text-only-browser-agent

  14. Hacker News. Multiple discussions on multi-agent systems, Claude Code, and autonomous agents (2025-2026) https://hn.algolia.com/