Files
Agentswarm/docs/benchmark/swarm-benchmark-protocol.md
T
Songhaoz666andClaude Opus 4.8 54cb327348 Agent Swarm v6:基准 v2.1、主控 Agent、实质性对等回复、客户端指南
- 基准标准 v2.1:SwarmMetrics(15 字段)、τ/η/P_decision/reward 公式、对称 G_E,c(修正 C_base=1.0 退化)、Σλ=1.0 校验;新增基线对比与运行记录 schema;指标覆盖缺口分析;参考系数暂留为元数据(待量化)。
- 主控 Agent 实体(分解 / 评审决策 / 汇总);事件契约修正(timeline.title、budget.threshold_pct、handoff 角色、task.released)+ 契约校验脚本。
- 实质性 LLM 对等回复(含降级回退);集成契约(runtime / event / usage / audit / frontend / capability / security);CLIENT_GUIDE 客户端指南;CI 工作流;治理与交付文档。

Co-Authored-By: Claude Opus 4.8 (1M context) <noreply@anthropic.com>
2026-06-09 16:21:18 +08:00

4.1 KiB
Raw Blame History

Swarm Benchmark Protocol

状态:规划中(协议已成文,采集器/基线/回放未落地)。

依据:Agent 蜂群指标量化与标准 v2.0。本目录其余文档对各分量展开:swarm-metrics-schema.md、emergence-evaluation.md、baseline-comparison.md、cost-normalized-gain.md、governance-score.md、telemetry-architecture.md。

1. 目标

统一蜂群评测体系:支持不同 Agent Framework 横向比较、持续优化与回归测试、Benchmark 排行榜。最终验收不是「能运行」或「能协作」,而是通过本协议自证(尤其涌现增益 G_E 与成本归一化增益 G_E,c)。

2. 综合评分 Benchmark_Agent

Benchmark_Agent = λ1·S_swarm + λ2·G_E + λ3·R + λ4·O + λ5·Gov
分量 含义 展开文档
S_swarm 蜂群能力 swarm-metrics-schema §蜂群层
G_E 涌现增益(vs baseline) emergence-evaluation
R 奖励函数 swarm-metrics-schema §执行层
O 可观测性 telemetry-architecture
Gov 治理能力 governance-score

λ 权重(v2.0,强制 Σλᵢ = 1.0):λ1=0.30(S_swarm)· λ2=0.20(G_E)· λ3=0.25(R)· λ4=0.15(O)· λ5=0.10(Gov)。benchmark/metrics.py:benchmark_agent 会校验 Σλ=1.0。

S_swarm 子权重(v2.0,未变):

S_swarm = 0.25·S_completion + 0.20·S_gain + 0.15·S_collaboration
        + 0.10·S_communication + 0.10·S_cost + 0.10·S_robustness + 0.10·S_governance

3. Benchmark Protocol(基线与实验组)

组 系统
Baseline A Single Agent
Baseline B Chain Agent
Baseline C Sub-Agent
Baseline D Strong Agent
Experimental Swarm Agent(本仓)

所有组统一采集:Completion、Quality、Cost、Time、Robustness。 蜂群成立的硬条件:Swarm > Single、Swarm > Chain、Swarm > Sub-Agent、Swarm > Strong(见 emergence-evaluation),且经成本归一化后增益非「堆 Agent/Token」虚高(见 cost-normalized-gain)。

3.1 超参数向量 Θ(v2.0 §7.2)

Θ = [α, β, ρ, N_agent, ε]      Θ* = argmax(Benchmark_Agent)

推荐初值:α=1.0、β=2.0、ρ=0.10(信息素挥发率)、N_agent=5、ε=0.10(探索率)。见 benchmark/metrics.py:THETA_DEFAULTS。

4. 场景(Leaderboard 维度)

Coding · Refactoring · Architecture · DevOps · Bug Fix。

5. Leaderboard 展示字段

Benchmark_Agent、S_swarm、G_E、G_E,c、Reward、Cost Efficiency。

6. 实现状态(本仓)

组件 位置(规划) 状态
指标定义 / schema docs/benchmark/*、SwarmMetrics ✅ 已成文
采集器 SwarmMetricsCollector benchmark/collectors/ 🟡 部分落地(SwarmRunMetricsCollector 真实计算 completion/collaboration/cost/robustness;其余 NaN+coverage)
基线运行器 A–D benchmark/baselines/ 🔴 未落地
回放 replay benchmark/replay/ 🔴 未落地
排行榜 leaderboard benchmark/leaderboard/ 🔴 未落地
数据采集架构 telemetry-architecture 🔴 未接入(OTel/Prometheus/ClickHouse/ES)

在采集器与基线运行器落地前,不得宣称本仓已具备 Agent Swarm 量化自证能力。

7. 验收标准(对齐工单)

  • 能输出完整 Benchmark_Agent。
  • 能量化 S_swarm、G_E、G_E,c、Gov。
  • 能回放一次 benchmark execution。
  • 能证明 Swarm > Single / Chain / Sub-Agent。
  • 能证明增益不依赖无限 token/GPU 堆叠(成本归一化)。

8. 待对齐

  • λ1…λ5 数值权重 ✅ v2.0 已给定(Σλ=1.0)。
  • Θ* 调优口径与搜索方法。
  • 各基线(Single/Chain/Sub-Agent/Strong)的标准实现与数据集。
  • Quality 的统一口径(TestPassRate / CodeReviewScore / UserAcceptance 来源)。
  • 数据源与平台(telemetry-architecture)。