- 基准标准 v2.1:SwarmMetrics(15 字段)、τ/η/P_decision/reward 公式、对称 G_E,c(修正 C_base=1.0 退化)、Σλ=1.0 校验;新增基线对比与运行记录 schema;指标覆盖缺口分析;参考系数暂留为元数据(待量化)。 - 主控 Agent 实体(分解 / 评审决策 / 汇总);事件契约修正(timeline.title、budget.threshold_pct、handoff 角色、task.released)+ 契约校验脚本。 - 实质性 LLM 对等回复(含降级回退);集成契约(runtime / event / usage / audit / frontend / capability / security);CLIENT_GUIDE 客户端指南;CI 工作流;治理与交付文档。 Co-Authored-By: Claude Opus 4.8 (1M context) <noreply@anthropic.com>
69 lines
3.1 KiB
Markdown
69 lines
3.1 KiB
Markdown
# Emergence Evaluation(涌现增益评估)
|
||
|
||
> 状态:**规划中(公式已对齐,基线运行器/评估器未落地)**。
|
||
>
|
||
> 依据:**Agent 蜂群指标量化与标准 v2.0 §6.1, §9**。配套:[`baseline-comparison.md`](./baseline-comparison.md)、[`cost-normalized-gain.md`](./cost-normalized-gain.md)、[`swarm-benchmark-protocol.md`](./swarm-benchmark-protocol.md)。
|
||
|
||
## 1. 原始增益
|
||
|
||
```
|
||
G_E = Q_swarm − Q_base
|
||
```
|
||
|
||
`Q_base` 取自四类基线之一(标准 §6.1,附**参考系数**,由低到高):
|
||
|
||
| 基准 | 类型 | 参考系数 |
|
||
|---|---|---|
|
||
| Baseline A | Single Agent | ×0.75 |
|
||
| Baseline B | Chain Agent | ×0.85 |
|
||
| Baseline C | Sub-Agent | ×0.90 |
|
||
| Baseline D | Strong Agent | ×0.95 |
|
||
|
||
> ⚠️ **参考系数为暂定值(待量化)**:×0.75/0.85/0.90/0.95 是人为设定的强度先验,标准未给计算方法;**当前不参与公式**(`G_E` 用原始 `Q_base`),仅作元数据。后续应实测量化(见 [`baseline-comparison.md §1.1`](./baseline-comparison.md))。代码常量见 `benchmark/metrics.py:BASE_COEFFICIENTS`。
|
||
|
||
## 2. 成立条件(蜂群是否真正优于基线)
|
||
|
||
蜂群成立要求对**全部**基线为正增益:
|
||
```
|
||
Q_swarm > Q_single ∧ Q_swarm > Q_strong ∧ Q_swarm > Q_chain ∧ Q_swarm > Q_sub
|
||
```
|
||
否则蜂群不成立(仅是「多 Agent 工作流」而非有涌现的蜂群)。
|
||
|
||
> 仅有原始增益不足以验收:还须经成本归一化(见 [`cost-normalized-gain.md`](./cost-normalized-gain.md)),证明增益非「堆 Agent / Token」虚高。
|
||
|
||
## 3. Q(质量)口径
|
||
|
||
`Q` 采用统一质量度量。建议复用标准 §5.3:
|
||
```
|
||
Q = Q_quality = 0.4·TestPassRate + 0.3·CodeReviewScore + 0.3·UserAcceptance
|
||
```
|
||
并在每组统一采集 `Completion / Quality / Cost / Time / Robustness`(标准 §10),按场景(Coding / Refactoring / Architecture / DevOps / Bug Fix)分别计算 `G_E`。
|
||
|
||
> ⚠️ `Q` 的精确口径(是否等于 `Q_quality`,或综合 Completion/Robustness)v2.0 未唯一指定 → 待对齐。
|
||
|
||
## 4. 评测流程(草案)
|
||
|
||
1. 固定任务集(按场景)。
|
||
2. 在 A/B/C/D 与 Swarm 上**同一任务集**运行,统一采集指标(见 swarm-metrics-schema §0)。
|
||
3. 计算每场景 `Q_*`,得 `G_E = Q_swarm − Q_base`。
|
||
4. 进入成本归一化(`G_E,c`)。
|
||
5. 多次运行取均值并报告方差/显著性。
|
||
|
||
## 5. 实现状态
|
||
|
||
| 组件 | 位置(规划) | 状态 |
|
||
|---|---|---|
|
||
| 基线运行器 A–D | `benchmark/baselines/` | 🔴 未实现 |
|
||
| 基线 benchmark 套件 / 数据集 | `benchmark/baselines/` + `test-data/` | 🔴 未实现 |
|
||
| 基线对比 | baseline-comparison | 🔴 未实现 |
|
||
| 涌现评估器(G_E) | `benchmark/` | 🔴 未实现 |
|
||
| 归一化增益评估器(G_E,c) | cost-normalized-gain | 🔴 未实现 |
|
||
|
||
> 在以上落地前,**不得宣称已验证蜂群涌现能力**(重大能力缺口)。
|
||
|
||
## 6. 待对齐
|
||
|
||
- `Q` 的唯一口径。
|
||
- 四类基线的标准实现(尤其 Strong Agent / Chain Agent / Sub-Agent 的定义边界)与统一数据集。
|
||
- 运行次数、方差/显著性门槛。
|