Глава 3. Экономика роя: когда 15× токенов окупаются
система тратит примерно в 15 раз больше , чем обычный чат, — и это не побочный эффект, а сам механизм её превосходства: по данным Anthropic, объём потраченных токенов в одиночку объясняет 80% разницы в качестве. Поэтому экономика роя сводится к двум вопросам: достаточно ли высока ценность задачи, чтобы оплатить множитель, и умеете ли вы инженерными средствами — тирингом моделей, , батчами и бюджетами — сбить его реальную цену в разы.
Откуда взялись 4×, 15× и 90,2%
Канонический источник цифр — инженерный пост Anthropic «How we built our multi-agent research system» (июнь 2025). Дословно: «agents typically use about 4× more tokens than chat interactions», а «multi-agent systems use about 15× more tokens than chats». Плата за это: система с Claude Opus 4 в роли ведущего и на Claude Sonnet 4 обошла одиночный Opus 4 на 90,2% на внутреннем research-эвале Anthropic. На BrowseComp три фактора объяснили 95% дисперсии качества, причём сами по себе — 80%, остальное — число tool-вызовов и выбор модели. Вывод авторов честен: «multi-agent systems require tasks where the value of the task is high enough to pay for the increased performance».
Три оговорки, без которых цитировать эти цифры нельзя:
- 15× — это замер одной внутренней системы середины 2025 года, а не закон природы. Он сделан до моделей с контекстом 1M токенов, дешёвых cache-reads и server-side compaction; обновлённый множитель ни один вендор к середине 2026 не опубликовал.
- Сравнение 90,2% не было выровнено по бюджету. Работа Tran & Kiela (arXiv 2604.02460, апрель 2026) показывает: при равных бюджетах «thinking»-токенов одиночный на multi-hop-рассуждениях стабильно догоняет или обгоняет системы. Значительная часть выигрыша роя — просто покупка дополнительных токенов, недоступных одному .
- Параллелизм покупает , а не деньги. Anthropic сообщает о сокращении времени исследования «до 90%» — при росте токенов в ~15×. Практический пример: параллельные субагенты Claude Code исчерпали окно Pro-плана за ~15 минут против ~30 минут последовательно — та же работа, вдвое быстрее сожжённая квота (dev.to).
Прайс-лист 2026: сырьё для тиринга
Экономику определяет не средняя цена , а разброс цен внутри линейки — именно он позволяет платить за интеллект только там, где он нужен. Цены на июль 2026, $ за 1M токенов input/output (Anthropic, OpenAI, Google):
| Модель | Input | Output | Роль в рое |
|---|---|---|---|
| Claude Fable 5 | $10 | $50 | топ-orchestrator, судья |
| Claude Opus 4.8 | $5 | $25 | lead-агент |
| Claude Sonnet 5 | $3 / интро $2 до 31.08.2026 | $15 / $10 | worker |
| Claude Haiku 4.5 | $1 | $5 | scout, классификатор |
| GPT-5.6 sol / terra / luna | $5 / $2.50 / $1 | $30 / $15 / $6 | аналогичная лестница |
| gpt-5.5-pro, gpt-5.4-pro | $30 | $180 | самые дорогие API-модели рынка |
| Gemini 3.5 Flash | $1.50 | $9 | дешёвый worker |
| Gemini 3.1 Pro (≤200K / >200K ctx) | $2 / $4 | $12 / $18 | у Google сохранилась long-context-наценка |
Здесь заканчивается открытая часть главы. Продолжение — по бесплатной регистрации: без оплаты, нужен только адрес почты.