- 基准标准 v2.1:SwarmMetrics(15 字段)、τ/η/P_decision/reward 公式、对称 G_E,c(修正 C_base=1.0 退化)、Σλ=1.0 校验;新增基线对比与运行记录 schema;指标覆盖缺口分析;参考系数暂留为元数据(待量化)。 - 主控 Agent 实体(分解 / 评审决策 / 汇总);事件契约修正(timeline.title、budget.threshold_pct、handoff 角色、task.released)+ 契约校验脚本。 - 实质性 LLM 对等回复(含降级回退);集成契约(runtime / event / usage / audit / frontend / capability / security);CLIENT_GUIDE 客户端指南;CI 工作流;治理与交付文档。 Co-Authored-By: Claude Opus 4.8 (1M context) <noreply@anthropic.com>
3.1 KiB
3.1 KiB
Emergence Evaluation(涌现增益评估)
状态:规划中(公式已对齐,基线运行器/评估器未落地)。
依据:Agent 蜂群指标量化与标准 v2.0 §6.1, §9。配套:
baseline-comparison.md、cost-normalized-gain.md、swarm-benchmark-protocol.md。
1. 原始增益
G_E = Q_swarm − Q_base
Q_base 取自四类基线之一(标准 §6.1,附参考系数,由低到高):
| 基准 | 类型 | 参考系数 |
|---|---|---|
| Baseline A | Single Agent | ×0.75 |
| Baseline B | Chain Agent | ×0.85 |
| Baseline C | Sub-Agent | ×0.90 |
| Baseline D | Strong Agent | ×0.95 |
⚠️ 参考系数为暂定值(待量化):×0.75/0.85/0.90/0.95 是人为设定的强度先验,标准未给计算方法;当前不参与公式(
G_E用原始Q_base),仅作元数据。后续应实测量化(见baseline-comparison.md §1.1)。代码常量见benchmark/metrics.py:BASE_COEFFICIENTS。
2. 成立条件(蜂群是否真正优于基线)
蜂群成立要求对全部基线为正增益:
Q_swarm > Q_single ∧ Q_swarm > Q_strong ∧ Q_swarm > Q_chain ∧ Q_swarm > Q_sub
否则蜂群不成立(仅是「多 Agent 工作流」而非有涌现的蜂群)。
仅有原始增益不足以验收:还须经成本归一化(见
cost-normalized-gain.md),证明增益非「堆 Agent / Token」虚高。
3. Q(质量)口径
Q 采用统一质量度量。建议复用标准 §5.3:
Q = Q_quality = 0.4·TestPassRate + 0.3·CodeReviewScore + 0.3·UserAcceptance
并在每组统一采集 Completion / Quality / Cost / Time / Robustness(标准 §10),按场景(Coding / Refactoring / Architecture / DevOps / Bug Fix)分别计算 G_E。
⚠️
Q的精确口径(是否等于Q_quality,或综合 Completion/Robustness)v2.0 未唯一指定 → 待对齐。
4. 评测流程(草案)
- 固定任务集(按场景)。
- 在 A/B/C/D 与 Swarm 上同一任务集运行,统一采集指标(见 swarm-metrics-schema §0)。
- 计算每场景
Q_*,得G_E = Q_swarm − Q_base。 - 进入成本归一化(
G_E,c)。 - 多次运行取均值并报告方差/显著性。
5. 实现状态
| 组件 | 位置(规划) | 状态 |
|---|---|---|
| 基线运行器 A–D | benchmark/baselines/ |
🔴 未实现 |
| 基线 benchmark 套件 / 数据集 | benchmark/baselines/ + test-data/ |
🔴 未实现 |
| 基线对比 | baseline-comparison | 🔴 未实现 |
| 涌现评估器(G_E) | benchmark/ |
🔴 未实现 |
| 归一化增益评估器(G_E,c) | cost-normalized-gain | 🔴 未实现 |
在以上落地前,不得宣称已验证蜂群涌现能力(重大能力缺口)。
6. 待对齐
Q的唯一口径。- 四类基线的标准实现(尤其 Strong Agent / Chain Agent / Sub-Agent 的定义边界)与统一数据集。
- 运行次数、方差/显著性门槛。