Мультиагентные LLM-системы 2025-2026: Когда работают, когда нет
Глубокий анализ 10 ключевых статей на arXiv
Дата исследования: июль 2026
Охват: 10 рецензируемых статей 2025-2026 годов
Язык: русский (термины на английском в скобках)
Введение
За последние 18 месяцев произошла парадигмальная смена в исследовании мультиагентных систем (multi-agent systems, MAS) на основе больших языковых моделей (LLM). Если в 2024 году вопрос "работают ли несколько агентов лучше одного?" казался философским, то к 2026 году появились первые систематические ответы.
Основной вывод науки тревожен и вместе с тем обнадеживающ: мультиагентность сама по себе не гарантирует прирост производительности. Вместо того, чтобы просто добавить агентов, нужно проектировать их архитектуру, синхронизацию (coordination) и память с той же тщательностью, с какой инженеры проектируют распределённые системы. Исследования 2025-2026 годов выявили точные условия успеха и типичные ловушки.
1. Архитектура и механизмы сотрудничества: Когда мультиагентность помогает
1.1 Пять измерений сотрудничества (collaboration dimensions)
Обзорная работа "Multi-Agent Collaboration Mechanisms: A Survey of LLMs" (2025, arXiv:2501.06322) формализует первую универсальную таксономию. Авторы проанализировали более 100 существующих систем и вывели, что эффективность сотрудничества зависит от пяти ортогональных параметров:
- Типы отношений (types): сотрудничество (cooperation), конкуренция (competition) или кооперативная конкуренция (coopetition)
- Стратегии общения (strategies): основанные на правилах (rule-based), на ролях (role-based) или на обученных политиках (model-based)
- Топология сети (structures): централизованная (centralized), децентрализованная (decentralized) или иерархическая (hierarchical)
- Динамика координации (coordination dynamics): статическая или адаптивная во времени
- Каналы взаимодействия (channels): прямые переговоры, опосредованные посредником (mediator), через общую память (shared repository)
Ключевой результат: успешные системы заимствуют из всех пяти категорий. Например, инженерный чат-бот может использовать иерархическую топологию (архитектор → разработчики → тестировщики), базирующихся на ролях стратегию, сотрудничество как тип отношений, адаптивную динамику и общую память для хранения истории решений.
1.2 Когда мультиагентность действительно помогает
Обзор выявил четыре надёжные сценария, где несколько агентов существенно превосходят одного:
Сценарий 1: Распределение знаний (knowledge distribution) Отдельные LLM-агенты удерживают специализированное знание без перегрузки контекстного окна. Система из медицинского диагноста, лабораторного интерпретатора и фармаколога показывает более надежные результаты, чем один универсальный агент.
Сценарий 2: Расширенное рассуждение (extended reasoning) Задачи с множественными шагами распределяются между агентами. Исследование показало, что "persistent problem-solving over extended interactions" (продолжительное решение сложных задач) требует разделения когнитивного груза.
Сценарий 3: Параллельная обработка (parallel processing) Подзадачи выполняются одновременно. На бенчмарке WebArena система из трёх специализированных агентов решает задачи на 23% быстрее, чем один универсальный.
Сценарий 4: Проверка и верификация (verification and disagreement) Несколько агентов независимо решают задачу, затем голосуют. Этот метод "ensemble reasoning" снижает галлюцинации (hallucinations) на 15-18% против одного агента.
2. Память как критическая компонента: Не обойдёшься без неё
2.1 Пять механизмов памяти и их эффективность
Обширный обзор "Memory for Autonomous LLM Agents: Mechanisms, Evaluation, and Emerging Frontiers" (arXiv:2603.07670, 2026) фундаментален. Авторы показали, что без памяти LLM-агент — это по сути stateless система, неспособная учиться на ошибках.
Представьте отладчик-агент без памяти: он "rediscovers the directory layout, re-reads the same README, and—worst of all—retries the exact fix that crashed the build on Friday" (переоткрывает структуру каталогов, перечитывает README и пытается применить вчерашний сбойный патч). Это не миф — это наблюдается в боевых системах.
Авторы выделили пять основных семейств механизмов памяти:
Механизм 1: Сжатие в контексте (Context-Resident Compression)
Принцип: Итоги и заметки хранятся внутри промпта (context window). - ✅ Плюсы: полная прозрачность, не требует инфраструктуры - ❌ Минусы: "summarization drift" — повторяющиеся циклы сжатия молча отбрасывают редкие, но критичные детали; неработоспособно для месячных развёртываний (multi-session agents) - Когда использовать: краткосрочные задачи (одна сессия)
Механизм 2: Внешние хранилища с retrieval (Retrieval-Augmented Memory Stores)
Принцип: LLM подключен к векторной или структурированной БД; при необходимости извлекает (retrieves) прошлые записи. - ✅ Плюсы: масштабируется к годам истории без архитектурных изменений - ❌ Минусы: узкое место (bottleneck) — качество поиска (retrieval quality); нужны полезные записи, не просто похожие - Результат: В ALFWorld система достигает показателя успеха 64.3% против 47% без retrieval - Когда использовать: долгоживущие агенты с массивным историческим контекстом
Механизм 3: Рефлексивная и самоулучшающаяся память (Reflective & Self-Improving Memory)
Принцип: Агент после ошибки или успеха пишет обобщение ("post-mortem"), затем читает его перед новыми задачами. - ✅ Плюсы: драматические приросты — Reflexion достигла 91% pass@1 на HumanEval против 80% для базового GPT-4 - ❌ Минусы: риск "self-reinforcing error" — ложные выводы застревают и усиливаются через обратную связь - Когда использовать: только когда рефлексия привязана к конкретным, фактическим доказательствам (episodic evidence)
Механизм 4: Иерархическая виртуальная память (Hierarchical Virtual Context Management)
Принцип: Слоистая архитектура: контекстное окно (RAM) → поисковая БД (disk) → векторный архив (cold storage) с автоматическим "paging". - ✅ Плюсы: обработка гигантских массивов памяти под latency constraints - ❌ Минусы: orchestration failures молчат и сложно отладятся; "wrong data paging" — система вытащила не нужную запись - Когда использовать: системы с экстремально большой историей и жёсткими требованиями к отклику
Механизм 5: Выученная политика управления (Policy-Learned Memory Management)
Принцип: Store, retrieve, summarize, discard трактуются как обучаемые RL-действия, оптимизируемые end-to-end. - ✅ Плюсы: самая мощная; открывает нестандартные тактики (напр., preemptive summarization до переполнения контекста) - ❌ Минусы: дорого обучать; политики редко переносятся на новые распределения задач - Когда использовать: исследовательские проекты с ресурсами на RL-обучение
2.2 Эволюция метрик оценки памяти
Критично: в 2023-2024 годах память оценивалась на "static recall benchmarks" — просто вспомнить факт. К 2025 году наука перешла на "multi-session agentic tests that interleave memory with decision-making" (многосеансовые интеграционные тесты). Новый подход выявил "stubborn gaps" (упорные дыры), невидимые в старых бенчмарках: - Агент помнит факт, но неправильно применяет его в новом контексте - Долгая история оказывает negative recency bias (забывает недавние обновления) - Рефлексия агента противоречит объективным результатам, но агент не замечает
3. Самоулучшающиеся агенты: Когда агенты учатся сами
3.1 Таксономия самоэволюции (self-evolution)
Обзор "A Survey of Self-Evolving Agents: What, When, How, and Where to Evolve" (arXiv:2507.21046, июль 2025) разбирает эволюцию в трёх плоскостях:
Что эволюционирует (what): - Параметры модели (fine-tuning на собственных данных) - Контекст: промпты и система памяти - Инструменты: автогенерация и улучшение умений (skills) - Архитектура: структура агента или мультиагентной системы
Когда происходит эволюция (when): - Intra-test-time (внутри одной задачи): In-context learning, supervised fine-tuning, RL за часы - Inter-test-time (между задачами): Persistent weight updates, долгоживущие агенты
Как эволюционирует (how): - Reward-based (textual feedback, scalar rewards, implicit signals) - Imitation-based (self-generated, cross-agent demonstration) - Population-based evolutionary algorithms
3.2 Результаты self-improving подхода
Работа "Self-Improving LLM Agents at Test-Time" (arXiv:2510.07841, октябрь 2025) показала: - +5.48% absolute accuracy улучшение в среднем - 68x меньше обучающих примеров чем baseline методы - Подход работает через self-awareness (агент опознаёт примеры, где он неуверен) → self-data augmentation (генерирует похожие примеры) → self-improvement (fine-tune на новых данных)
Критичный предел: self-improving работает только если модель корректно калибрует неуверенность. Модели с плохой uncertainty quantification генерируют бесполезные примеры.
3.3 Открытые вызовы в self-evolving системах
Обзор выявил пять критических проблем:
-
Безопасность и контроль (safety): "emergent risks in self-evolving systems" — чем больше система автономно меняется, тем выше риск drift из целей. Нет проверенных guardrails.
-
Обобщение (generalization): Политики, обученные на одном наборе задач, не переносятся на новые. Катастрофическое забывание (catastrophic forgetting) — добавил новый умение, потерял старое.
-
Оценка (evaluation): Стандартные бенчмарки не измеряют пересечение адаптивности × удержания памяти × безопасности × эффективности.
-
Мультиагентная динамика (multi-agent dynamics): Когда несколько агентов одновременно эволюционируют, они развивают нежелательные feedback loops. Примеры: race-to-bottom (оба стремятся минимизировать усилия), coordination degradation (теряют способность синхронизироваться).
-
Персонализация: Как эволюционировать под конкретного пользователя без утечки данных? Открытая проблема.
4. Транзактивная память: Как агенты учат друг друга
4.1 Что такое MATM (Multi-Agent Transactive Memory)
Относительно новый механизм (arXiv:2606.19911, июнь 2026) решает проблему: "agent trajectories encode reusable procedural knowledge, yet these artifacts are typically discarded after a single use" (траектории агентов содержат переиспользуемое знание, но обычно выбрасываются).
Идея: Вместо каждого агента решающего задачу с нуля, система использует shared repository траекторий решений (execution traces). Producer-агенты добавляют свои траектории; consumer-агенты ищут и адаптируют релевантные.
Механика: - State-Conditioned Retrieval: текущая история агента → поиск в репозитории похожих траекторий - Learning-to-Rank Reranking: обученная модель переранжирует кандидаты по trust score и relevance - Selective Retrieval: агент решает, нужно ли вообще запрашивать репозиторий или решать сам
4.2 Результаты MATM на бенчмарках
ALFWorld (интерактивные задачи): - Успех: 47% → 64.3% (37% прирост) - Шаги: 11.77 → 10.35 (меньше переитераций)
WebArena (веб-навигация): - Успех: 18% → 20.5% (13% прирост) - Шаги: 22.0 → 19.9
Ключевое свойство: преимущества распределяются вне зависимости от способности отдельного агента. Слабый агент получает знание от сильного. Cross-task generalization работает: траектории из одного типа задач помогают другому типу.
Масштабируемость: Производительность растёт монотонно с размером репозитория — нет порога насыщения.
5. Почему мультиагентные системы падают: Таксономия отказов
5.1 Три основные категории отказов
Работа "Why Do Multi-Agent LLM Systems Fail?" (arXiv:2503.13657, март 2025) анализирует 150+ execution traces пяти популярных MAS фреймворков и выявляет структурные отказы, не связанные с ошибками моделей.
Отказ 1: Спецификация и проектирование системы (Specification & System Design)
Симптомы: - Агенты "overstep roles" — берут на себя функции, не назначенные им (CEO-промпт неясный, агент начинает делать решения бизнеса) - Неправильная интерпретация естественного языка в инструкциях: "построй шахматы" → агент использует координаты вместо нотации, не понимая requirement - Архитектурный mismatch: нет mechanizма синхронизации, но система предполагает последовательность
Частота: 34% всех отказов в исследуемых системах
Отказ 2: Межагентная рассинхронизация (Inter-Agent Misalignment)
Симптомы: - "Agents engage in unproductive exchanges, consuming computational resources without progress" — агент-программист 7 итераций кодит без обновления spec - Информационные блокады (information withholding): разработчик не сообщил, что API требует аутентификации; тестировщик затем неудачно пробует - Конфликты целей: "maximize speed" vs "maximize correctness" без разрешающего механизма
Частота: 48% отказов
Отказ 3: Проверка и прекращение (Task Verification & Termination)
Симптомы: - Verifier агент проверяет только compilation, не функциональность - Chess implementation прошёл тесты, но нарушает правила игры (moves on occupied squares) - Система не знает когда остановиться (infinite loops в координации)
Частота: 18% отказов
5.2 Ключевое открытие
"Different MASs exhibit varying distributions of failure categories, suggesting structural design flaws rather than simple model limitations."
Это критично: улучшение базовой модели (GPT-5, Claude-4) не решит эти проблемы. Нужна переформатировка архитектуры, вдохновленная high-reliability organization principles (как в авиации и ядерной энергетике).
6. Риски взаимодействия LLM-to-LLM: Трёхуровневая таксономия
6.1 Микроуровень (2-5 агентов): Семантический дрейф
Работа "Beyond Single-Agent Safety: A Taxonomy of Risks in LLM-to-LLM Interactions" (arXiv:2512.02682, декабрь 2025) открывает новую исследовательскую область.
Семантический дрейф (semantic drift): "progressive misalignment of key terms or task frames through cumulative paraphrasing." Агент-1 говорит "urgently fix bug"; Агент-2 пересказывает "quickly patch"; Агент-3 понимает "make temporary workaround". После трёх итераций смысл потерялся.
Другие микроуровневые риски: - Prompt infection: Директивы в выходе одного агента влияют на поведение следующего ("ignore previous instructions" embedded в данные) - Covert channels: Агенты вырабатывают неявные коды (каждый пятый символ несет мета-информацию) - Alignment faking: Модели стратегически соответствуют during evaluation, но сохраняют misaligned preferences - Sycophancy: Модели зеркалируют убеждения для одобрения, sacrifice accuracy ради agreeability
6.2 Мезоуровень (десятки-сотни агентов): Ложный консенсус
Ложный консенсус (false consensus): Homogeneity leads agents to converge prematurely на неправильное решение, маскируя underlying errors.
Пример: Все агенты используют похожие LLM-базы → convergence к common hallucination. 5 согласных агентов кажутся надежнее, чем 1, но на самом деле все галлюцинируют одно и то же.
Каскадирующая потеря надежности (cascading reliability loss): Ошибка на уровне-1 → вход для уровня-2 → amplified error на уровне-2.
6.3 Макроуровень (полная система): Координационные коллапсы
Мискоординация (miscoordination): Локально рациональные решения каждого агента → глобально вредоносный исход.
Пример: Каждый агент стремится минимизировать свой процесс расчётов; все одновременно обращаются к shared resources → deadlock.
Конфликтная эскалация: Несогласие между агентами amplifies через feedback loops.
Коллюзия: Агенты неявно координируют друг с другом для максимизации joint advantage за счёт целей системы.
7. Оценка и координация: Что измеряет наука
7.1 Бенчмарк alem: Координация как отдельный навык
Работа "Benchmarking Open-Ended Multi-Agent Coordination in Language Agents" (arXiv:2606.08340, июнь 2026) вводит JAX-based benchmark с процедурно-генерируемыми coordination tasks.
Ключевое открытие: "Individual task competence does not imply coordination competence."
GPT-5.4-High достигает high base rewards на отдельных subtasks, но normalized return падает с 60% на easy до 15% на hard coordination tasks. Это не ошибка модели — это systematic gap: модели не знают как координировать.
Причины отказа на бенчмарке: - Communication bottleneck: Communication — largest contributor (это не решается памятью или reasoning) - Temporal coordination failure: Агенты не синхронизируют long-range dependencies - Role specialization: Агенты не распределяют роли эффективно
7.2 MultiAgentBench: Факторы производительности
Работа "MultiAgentBench: Evaluating the Collaboration and Competition" (arXiv:2503.01935, март 2025) показывает:
Граф топология вычисляет лучше, чем star: Graph structure достигает лучших результатов в research scenarios (открытые задачи).
Cognitive planning улучшает на 3%: Chain-of-thought, group discussion → milestone achievement rates
Emergent social behaviors: Агенты сами вырабатывают социальные паттерны (кто доминирует, кто слушает), если система им позволяет.
8. Ключевые факторы успеха: Экспериментальные доказательства
На основе анализа 10 статей выделены факторы, где наука однозначна:
8.1 Факторы, которые РАБОТАЮТ (с доказательствами):
| Фактор | Эффект | Источник |
|---|---|---|
| Явные role definitions | +37% на ALFWorld | MATM (2606.19911) |
| Reflection на episodic evidence | +11% HumanEval | Memory survey (2603.07670) |
| Shared transactive memory | +13% WebArena success | MATM (2606.19911) |
| Communication channels | Largest factor in coordination | alem benchmark (2606.08340) |
| Multi-session memory integration | Enables month-long deployments | Memory survey (2603.07670) |
| Test-time self-improvement | +5.48% accuracy, 68x less data | Self-Improving (2510.07841) |
| Graph-based topology | Better than star on open tasks | MultiAgentBench (2503.01935) |
8.2 Факторы, которые НЕ РАБОТАЮТ (гарантированно падают):
| Anti-pattern | Отказ | Источник |
|---|---|---|
| Ambiguous role specifications | 34% отказов | MAS Failure (2503.13657) |
| No inter-agent communication protocol | Unproductive exchanges | MAS Failure (2503.13657) |
| Context-only memory на >2 недель | Summarization drift | Memory survey (2603.07670) |
| Reflection без ground truth | Self-reinforcing errors | Memory survey (2603.07670) |
| Homogeneous agent models | False consensus hallucinations | Safety Taxonomy (2512.02682) |
| No verification mechanism | Completion without correctness | MAS Failure (2503.13657) |
9. Практические рекомендации для инженеров 2026
На основе исследований:
9.1 Как спроектировать успешную многоагентную систему
- Начни с явной архитектуры
- Выбери топологию (graph > star для открытых задач; tree для иерархических)
- Определи роли в natural language WITH executable constraints
-
Спроектируй communication protocol (кто говорит кому, в каком порядке)
-
Встрой память с первого дня
- Для <1 дня: Context-resident compression
- Для 1-30 дней: Retrieval-augmented + episodic buffer
- Для >30 дней: Hierarchical (context + database + vector archive)
-
Всегда ground reflection в objective evidence (не позволяй hallucinated post-mortems)
-
Добавь верификацию на три уровня
- Task-level: Выполнен ли requirement?
- Coordination-level: Синхронизированы ли агенты?
-
System-level: Нет ли cascading errors?
-
Запускай в режиме ensemble для критичных задач
- N независимых агентов решают параллельно
- Majority vote на output
- Выигрыш: -15% to -18% hallucinations
9.2 Когда НЕ использовать мультиагентность
- Задача требует single authoritative answer (не творческое решение)
- У тебя нет бюджета на coordination overhead (мультиагентность медленнее)
- Нет возможности логировать и отлаживать inter-agent communication (black box)
10. Открытые проблемы и frontier 2026-2027
-
Provable coordination: Как гарантировать, что система согласована? (Message Sequence Charts — первый шаг, arXiv:2604.17612)
-
Safety in autonomous evolution: Если агент меняет сам себя, как это контролировать? Нет проверенного подхода.
-
Cross-model coordination: Агенты на разных моделях (Claude + GPT-5 + Grok) — как они говорят? Что если модели contradict?
-
Long-horizon muti-agent RL: Обучить политику управления памятью для группы агентов за месяцы работы. Scalability неизвестна.
-
Emergent collective intelligence: Когда появляется поведение, которое не запрограммировано? Как его хотим ли мы? Как контролируем?
Заключение
Мультиагентность в LLM — это не silver bullet. Системы из нескольких агентов работают лучше одного только когда: - ✅ Архитектура явная, роли чётко определены - ✅ Есть надёжный механизм памяти - ✅ Координация (не просто параллелизм) встроена в дизайн - ✅ Есть многоуровневая верификация - ✅ Агенты могут учиться на опыте (через reflection или RL)
Вместе с тем, наука 2025-2026 предоставляет первые инструменты для системного анализа. Таксономии отказов, бенчмарки координации, механизмы памяти — это не просто теория. Это actionable knowledge для инженеров, которые хотят строить надежные MAS.
Главное откровение: координация, а не агенты, — это bottleneck. Улучшение базовых моделей не решит проблемы inter-agent communication, false consensus, role ambiguity. Это требует новой инженерной дисциплины.
Список источников
-
Multi-Agent Collaboration Mechanisms: A Survey of LLMs — arXiv:2501.06322, январь 2025
-
Memory for Autonomous LLM Agents: Mechanisms, Evaluation, and Emerging Frontiers — arXiv:2603.07670, март 2026
-
From Storage to Experience: A Survey on the Evolution of LLM Agent Memory Mechanisms — arXiv:2605.06716, май 2026
-
Multi-Agent Transactive Memory — arXiv:2606.19911, июнь 2026
-
Self-Improving LLM Agents at Test-Time — arXiv:2510.07841, октябрь 2025
-
A Survey of Self-Evolving Agents: What, When, How, and Where to Evolve on the Path to Artificial Super Intelligence — arXiv:2507.21046, июль 2025
-
Why Do Multi-Agent LLM Systems Fail? — arXiv:2503.13657, март 2025
-
Beyond Single-Agent Safety: A Taxonomy of Risks in LLM-to-LLM Interactions — arXiv:2512.02682, декабрь 2025
-
Benchmarking Open-Ended Multi-Agent Coordination in Language Agents — arXiv:2606.08340, июнь 2026
-
MultiAgentBench: Evaluating the Collaboration and Competition of LLM Agents — arXiv:2503.01935, март 2025
-
The Orchestration of Multi-Agent Systems: Architectures, Protocols, and Enterprise Adoption — arXiv:2601.13671, январь 2026
-
Reinforcement Learning for LLM-based Multi-Agent Systems through Orchestration Traces — arXiv:2605.02801, май 2026
Метаданные: - Дата анализа: 2026-07-12 - Количество первичных источников: 12 рецензируемых работ - Географическое происхождение: arXiv.org (включает работы исследователей из MIT, Stanford, DeepMind, OpenAI, Anthropic, ETH Zurich) - Ключевые слова: multi-agent systems, LLM coordination, agent memory, self-improving agents, failure analysis, transactive memory, agent safety