Files
Agentswarm/docs/benchmark/emergence-evaluation.md
T
Songhaoz666andClaude Opus 4.8 54cb327348 Agent Swarm v6:基准 v2.1、主控 Agent、实质性对等回复、客户端指南
- 基准标准 v2.1:SwarmMetrics(15 字段)、τ/η/P_decision/reward 公式、对称 G_E,c(修正 C_base=1.0 退化)、Σλ=1.0 校验;新增基线对比与运行记录 schema;指标覆盖缺口分析;参考系数暂留为元数据(待量化)。
- 主控 Agent 实体(分解 / 评审决策 / 汇总);事件契约修正(timeline.title、budget.threshold_pct、handoff 角色、task.released)+ 契约校验脚本。
- 实质性 LLM 对等回复(含降级回退);集成契约(runtime / event / usage / audit / frontend / capability / security);CLIENT_GUIDE 客户端指南;CI 工作流;治理与交付文档。

Co-Authored-By: Claude Opus 4.8 (1M context) <noreply@anthropic.com>
2026-06-09 16:21:18 +08:00

3.1 KiB
Raw Blame History

Emergence Evaluation(涌现增益评估)

状态:规划中(公式已对齐,基线运行器/评估器未落地)。

依据:Agent 蜂群指标量化与标准 v2.0 §6.1, §9。配套:baseline-comparison.md、cost-normalized-gain.md、swarm-benchmark-protocol.md。

1. 原始增益

G_E = Q_swarm − Q_base

Q_base 取自四类基线之一(标准 §6.1,附参考系数,由低到高):

基准 类型 参考系数
Baseline A Single Agent ×0.75
Baseline B Chain Agent ×0.85
Baseline C Sub-Agent ×0.90
Baseline D Strong Agent ×0.95

⚠️ 参考系数为暂定值(待量化):×0.75/0.85/0.90/0.95 是人为设定的强度先验,标准未给计算方法;当前不参与公式(G_E 用原始 Q_base),仅作元数据。后续应实测量化(见 baseline-comparison.md §1.1)。代码常量见 benchmark/metrics.py:BASE_COEFFICIENTS。

2. 成立条件(蜂群是否真正优于基线)

蜂群成立要求对全部基线为正增益:

Q_swarm > Q_single  ∧  Q_swarm > Q_strong  ∧  Q_swarm > Q_chain  ∧  Q_swarm > Q_sub

否则蜂群不成立(仅是「多 Agent 工作流」而非有涌现的蜂群)。

仅有原始增益不足以验收:还须经成本归一化(见 cost-normalized-gain.md),证明增益非「堆 Agent / Token」虚高。

3. Q(质量)口径

Q 采用统一质量度量。建议复用标准 §5.3:

Q = Q_quality = 0.4·TestPassRate + 0.3·CodeReviewScore + 0.3·UserAcceptance

并在每组统一采集 Completion / Quality / Cost / Time / Robustness(标准 §10),按场景(Coding / Refactoring / Architecture / DevOps / Bug Fix)分别计算 G_E。

⚠️ Q 的精确口径(是否等于 Q_quality,或综合 Completion/Robustness)v2.0 未唯一指定 → 待对齐。

4. 评测流程(草案)

  1. 固定任务集(按场景)。
  2. 在 A/B/C/D 与 Swarm 上同一任务集运行,统一采集指标(见 swarm-metrics-schema §0)。
  3. 计算每场景 Q_*,得 G_E = Q_swarm − Q_base。
  4. 进入成本归一化(G_E,c)。
  5. 多次运行取均值并报告方差/显著性。

5. 实现状态

组件 位置(规划) 状态
基线运行器 A–D benchmark/baselines/ 🔴 未实现
基线 benchmark 套件 / 数据集 benchmark/baselines/ + test-data/ 🔴 未实现
基线对比 baseline-comparison 🔴 未实现
涌现评估器(G_E) benchmark/ 🔴 未实现
归一化增益评估器(G_E,c) cost-normalized-gain 🔴 未实现

在以上落地前,不得宣称已验证蜂群涌现能力(重大能力缺口)。

6. 待对齐

  • Q 的唯一口径。
  • 四类基线的标准实现(尤其 Strong Agent / Chain Agent / Sub-Agent 的定义边界)与统一数据集。
  • 运行次数、方差/显著性门槛。