阶段0(定口径,docs/benchmark/emergence-evaluation.md §6 v2.1-impl): - S_gain ≡ G_E(差值,不强制归一 [0,100],与标准「见涌现增益」字面一致)。 - 聚合 S_gain 取对最强基线(Q_base 最大)的 G_E(最保守,避免挑弱基线虚高)。 - Q ≡ Q_quality;swarm_valid 仍要求对全部基线 G_E>0 且 G_E,c>0。 阶段1(采集器): - 新增 benchmark/collectors/selfcert_collector.py:把套件 5 份 BenchmarkRunRecord (swarm+4基线)+ 可选活体 SwarmMetrics 合流,经 baselines.compare 算 G_E/G_E,c, 补全 run_collector 无法自算的 s_gain/g_e/g_e_cost/s_swarm,可能时产出 Benchmark_Agent。 - benchmark/leaderboard:实现排行榜聚合+渲染(标准 §11 字段)。 - run-benchmark-suite.py 接入自证 + leaderboard 输出。 诚实纪律(组织规则 #9):缺真实输入一律 NaN+coverage False,不伪造。 - O(可观测性)标准无公式 → 恒 NaN;Gov 计数器未实现 → 无活体治理则 NaN。 - 故完整 Benchmark_Agent 数字仍待 O 公式 + Gov 计数器(阶段2),采集器明列缺口。 验证:新增 test-benchmark-selfcert.py(17 项)+ 现有 benchmark 测试(metrics/ collector/comparison/runners)+ offline suite + 契约冒烟(runtime/merge/freeze)全 PASS。 影响范围:仅 agent_swarm benchmark 模块 + docs;不改 Manager↔Swarm 契约/计费/审计/密钥/发布链路。 Co-Authored-By: Claude Opus 4.8 (1M context) <noreply@anthropic.com>
benchmark/ —— 蜂群基准(骨架)
对应 docs/benchmark/ 的标准实现入口。依据 Agent 蜂群指标量化与标准 v2.0。
实现状态
| 模块 | 内容 | 状态 |
|---|---|---|
metrics.py |
v2.0 SwarmMetrics(15 字段)+ 纯公式(pheromone/heuristic/p_decision/reward/completion/collaboration/communication/cost/robustness/governance/swarm_score/emergence_gain/swarm_cost/cost_normalized_gain/benchmark_agent)+ v2.0 推荐权重常量 |
✅ 已实现、可单测(test-benchmark-metrics.py) |
collectors/ |
base SwarmMetricsCollector + SwarmRunMetricsCollector(无条件计算 s_completion/s_collaboration/s_robustness,有条件计算 s_cost/s_governance/s_communication/reward/tau/eta/p_decision;其余标记 NaN + coverage=False) |
🟡 部分落地(单次 run 最多 10/15 字段真实可算) |
fixtures/ |
留出(held-out)任务 fixture + 加载器;reward 的 Q_quality 评分源 |
🟡 1 个示例 fixture(add_function),统一任务集待扩充 |
| 决策引擎 | orchestrator/decision_engine.py(τ trail + η 评分 + ε-greedy 采样,ENABLE_ACO_DISPATCH 门控;见 docs/benchmark/decision-engine.md) |
🟡 Option A 单边已落地;Option B 与决策质量验证待 Group C |
baselines/ |
BenchmarkRunRecord + compare/evaluate(G_E/G_E,c) |
✅ 已实现 |
tasksets/ |
统一基准任务集(coding-set-1) |
🟡 1 个示例任务集(#20) |
runners/ |
single/strong/chain/sub_agent/swarm + 共享 backend(Offline/OpenAI) | 🟡 管线已落地;真实数值需 key(#21) |
reports/ |
G_E/G_E,c/coverage/confidence + Markdown | ✅ 已实现(#22 部分) |
replay/ |
记录/报告归档(records/report/md/meta) | 🟡 最小回放(#22 部分) |
leaderboard/ |
排行榜聚合 | 🔴 未落地 |
公式可计算 ≠ 能自证。基线运行管线(runners/tasksets/reports/replay)已落地,但 Offline 仅验证管线 (无偏、G_E=0),真实
G_E>0需--backend openai+ 冻结任务集 + 多次运行。在拿到真实结果前, 不得宣称已具备 Agent Swarm 量化自证能力(不能证明Swarm > Single/Chain/Sub/Strong,也无法输出完整Benchmark_Agent)。入口scripts/run-benchmark-suite.py,说明见docs/benchmark/baseline-runners.md。
待落地(按依赖顺序)
collectors/:接入事件流 / Prometheus / OTel / 任务与用量(telemetry-architecture)。baselines/:四类基线 + 统一任务集(emergence-evaluation / baseline-comparison)。replay/、leaderboard/。- 权重 v2.0 已给定(
λ/w*/γ*,Σλ=1.0);α/β/ρ/N_agent/ε用THETA_DEFAULTS推荐初值,调优口径待定。