- 基准标准 v2.1:SwarmMetrics(15 字段)、τ/η/P_decision/reward 公式、对称 G_E,c(修正 C_base=1.0 退化)、Σλ=1.0 校验;新增基线对比与运行记录 schema;指标覆盖缺口分析;参考系数暂留为元数据(待量化)。 - 主控 Agent 实体(分解 / 评审决策 / 汇总);事件契约修正(timeline.title、budget.threshold_pct、handoff 角色、task.released)+ 契约校验脚本。 - 实质性 LLM 对等回复(含降级回退);集成契约(runtime / event / usage / audit / frontend / capability / security);CLIENT_GUIDE 客户端指南;CI 工作流;治理与交付文档。 Co-Authored-By: Claude Opus 4.8 (1M context) <noreply@anthropic.com>
4.1 KiB
Swarm Benchmark Protocol
状态:规划中(协议已成文,采集器/基线/回放未落地)。
依据:Agent 蜂群指标量化与标准 v2.0。本目录其余文档对各分量展开:
swarm-metrics-schema.md、emergence-evaluation.md、baseline-comparison.md、cost-normalized-gain.md、governance-score.md、telemetry-architecture.md。
1. 目标
统一蜂群评测体系:支持不同 Agent Framework 横向比较、持续优化与回归测试、Benchmark 排行榜。最终验收不是「能运行」或「能协作」,而是通过本协议自证(尤其涌现增益 G_E 与成本归一化增益 G_E,c)。
2. 综合评分 Benchmark_Agent
Benchmark_Agent = λ1·S_swarm + λ2·G_E + λ3·R + λ4·O + λ5·Gov
| 分量 | 含义 | 展开文档 |
|---|---|---|
S_swarm |
蜂群能力 | swarm-metrics-schema §蜂群层 |
G_E |
涌现增益(vs baseline) | emergence-evaluation |
R |
奖励函数 | swarm-metrics-schema §执行层 |
O |
可观测性 | telemetry-architecture |
Gov |
治理能力 | governance-score |
λ 权重(v2.0,强制 Σλᵢ = 1.0):λ1=0.30(S_swarm)· λ2=0.20(G_E)· λ3=0.25(R)· λ4=0.15(O)· λ5=0.10(Gov)。benchmark/metrics.py:benchmark_agent 会校验 Σλ=1.0。
S_swarm 子权重(v2.0,未变):
S_swarm = 0.25·S_completion + 0.20·S_gain + 0.15·S_collaboration
+ 0.10·S_communication + 0.10·S_cost + 0.10·S_robustness + 0.10·S_governance
3. Benchmark Protocol(基线与实验组)
| 组 | 系统 |
|---|---|
| Baseline A | Single Agent |
| Baseline B | Chain Agent |
| Baseline C | Sub-Agent |
| Baseline D | Strong Agent |
| Experimental | Swarm Agent(本仓) |
所有组统一采集:Completion、Quality、Cost、Time、Robustness。
蜂群成立的硬条件:Swarm > Single、Swarm > Chain、Swarm > Sub-Agent、Swarm > Strong(见 emergence-evaluation),且经成本归一化后增益非「堆 Agent/Token」虚高(见 cost-normalized-gain)。
3.1 超参数向量 Θ(v2.0 §7.2)
Θ = [α, β, ρ, N_agent, ε] Θ* = argmax(Benchmark_Agent)
推荐初值:α=1.0、β=2.0、ρ=0.10(信息素挥发率)、N_agent=5、ε=0.10(探索率)。见 benchmark/metrics.py:THETA_DEFAULTS。
4. 场景(Leaderboard 维度)
Coding · Refactoring · Architecture · DevOps · Bug Fix。
5. Leaderboard 展示字段
Benchmark_Agent、S_swarm、G_E、G_E,c、Reward、Cost Efficiency。
6. 实现状态(本仓)
| 组件 | 位置(规划) | 状态 |
|---|---|---|
| 指标定义 / schema | docs/benchmark/*、SwarmMetrics |
✅ 已成文 |
采集器 SwarmMetricsCollector |
benchmark/collectors/ |
🟡 部分落地(SwarmRunMetricsCollector 真实计算 completion/collaboration/cost/robustness;其余 NaN+coverage) |
| 基线运行器 A–D | benchmark/baselines/ |
🔴 未落地 |
| 回放 replay | benchmark/replay/ |
🔴 未落地 |
| 排行榜 leaderboard | benchmark/leaderboard/ |
🔴 未落地 |
| 数据采集架构 | telemetry-architecture | 🔴 未接入(OTel/Prometheus/ClickHouse/ES) |
在采集器与基线运行器落地前,不得宣称本仓已具备 Agent Swarm 量化自证能力。
7. 验收标准(对齐工单)
- 能输出完整
Benchmark_Agent。 - 能量化
S_swarm、G_E、G_E,c、Gov。 - 能回放一次 benchmark execution。
- 能证明
Swarm > Single / Chain / Sub-Agent。 - 能证明增益不依赖无限 token/GPU 堆叠(成本归一化)。
8. 待对齐
✅ v2.0 已给定(Σλ=1.0)。λ1…λ5数值权重Θ*调优口径与搜索方法。- 各基线(Single/Chain/Sub-Agent/Strong)的标准实现与数据集。
Quality的统一口径(TestPassRate / CodeReviewScore / UserAcceptance 来源)。- 数据源与平台(telemetry-architecture)。