Когда делить на субагентов, как строить тулы, чтобы модель не терялась, и чем мерить полезность тула.
Ключевое: outcome в БД, не слова агента. «Я забронировал» ≠ бронь существует.
| Метрика | Суть | Gold? |
|---|---|---|
| Tool selection accuracy | Правильный тул выбран | да |
| Tool-call F1 | P/R по множеству вызовов | да |
| Argument validity | Схема + enum + инвариант (сумма > 0) | нет, код |
| Unnecessary calls | Вызов без изменения состояния | эвристика |
| pass^k | Успех во всех k прогонах | да |
τ-bench (Sierra): метрика pass^k — стабильность, не pass@k. На airline Claude 3.5 Sonnet: pass^1 = 0.46, pass^4 = 0.225. Таксономия ошибок: used_wrong_tool, used_wrong_tool_argument, took_unintended_action, goal_partially_completed.
Источник: τ-bench.
user_id, не user.cards_get_balance, а не два «search».[].action=, не 3 тула.Anthropic на SWE-bench потратили на тулы больше времени, чем на системный промпт. Пример: relative paths ломались после cd → обязали absolute paths — ошибки исчезли.
Источники: Writing tools for agents, Building Effective Agents.
Принципы Cognition (Devin):
Пример: «Flappy Bird» → субагент 1 делает фон в стиле Mario, субагент 2 — птицу не в том стиле. Lead не склеивает.
Claude Code: субагенты не работают параллельно с основным и обычно только отвечают на вопрос — из-за потери контекста.
Источник: Cognition — Don't Build Multi-Agents.
Anthropic Research: субагенты выигрывают на breadth-first, независимых направлениях, когда работа не влезает в одно окно. Их результат: +90.2% против одного агента на research-eval.
Цена: multi-agent ~15× токенов чата. Token usage объяснил ~80% дисперсии качества на BrowseComp.
Условия: подзадачи независимо параллелятся, задача платит 15× токенов, worker отдаёт артефакт в filesystem (не через «испорченный телефон»), lead получает ссылку, не простыню токенов.
Источник: Anthropic multi-agent research.
A/B на одном golden set: success вырос на независимых осях, конфликты артефактов не выросли. Если success не вырос, а $ вырос — выкинь субагентов.
Каре-бот банка: 80% — FAQ и статус карты, это router + RAG, не рой агентов.
Что такое poka-yoke в ACI?
Главный принцип Cognition?
Multi-agent жжёт токенов примерно?