Files
Agentswarm/docs/benchmark/emergence-evaluation.md
T
Songhaoz666andClaude Opus 4.8 54cb327348 Agent Swarm v6:基准 v2.1、主控 Agent、实质性对等回复、客户端指南
- 基准标准 v2.1:SwarmMetrics(15 字段)、τ/η/P_decision/reward 公式、对称 G_E,c(修正 C_base=1.0 退化)、Σλ=1.0 校验;新增基线对比与运行记录 schema;指标覆盖缺口分析;参考系数暂留为元数据(待量化)。
- 主控 Agent 实体(分解 / 评审决策 / 汇总);事件契约修正(timeline.title、budget.threshold_pct、handoff 角色、task.released)+ 契约校验脚本。
- 实质性 LLM 对等回复(含降级回退);集成契约(runtime / event / usage / audit / frontend / capability / security);CLIENT_GUIDE 客户端指南;CI 工作流;治理与交付文档。

Co-Authored-By: Claude Opus 4.8 (1M context) <noreply@anthropic.com>
2026-06-09 16:21:18 +08:00

69 lines
3.1 KiB
Markdown
Raw Blame History

This file contains ambiguous Unicode characters
This file contains Unicode characters that might be confused with other characters. If you think that this is intentional, you can safely ignore this warning. Use the Escape button to reveal them.
# Emergence Evaluation(涌现增益评估)
> 状态:**规划中(公式已对齐,基线运行器/评估器未落地)**。
>
> 依据:**Agent 蜂群指标量化与标准 v2.0 §6.1, §9**。配套:[`baseline-comparison.md`](./baseline-comparison.md)、[`cost-normalized-gain.md`](./cost-normalized-gain.md)、[`swarm-benchmark-protocol.md`](./swarm-benchmark-protocol.md)。
## 1. 原始增益
```
G_E = Q_swarm − Q_base
```
`Q_base` 取自四类基线之一(标准 §6.1,附**参考系数**,由低到高):
| 基准 | 类型 | 参考系数 |
|---|---|---|
| Baseline A | Single Agent | ×0.75 |
| Baseline B | Chain Agent | ×0.85 |
| Baseline C | Sub-Agent | ×0.90 |
| Baseline D | Strong Agent | ×0.95 |
> ⚠️ **参考系数为暂定值(待量化)**:×0.75/0.85/0.90/0.95 是人为设定的强度先验,标准未给计算方法;**当前不参与公式**(`G_E` 用原始 `Q_base`),仅作元数据。后续应实测量化(见 [`baseline-comparison.md §1.1`](./baseline-comparison.md))。代码常量见 `benchmark/metrics.py:BASE_COEFFICIENTS`。
## 2. 成立条件(蜂群是否真正优于基线)
蜂群成立要求对**全部**基线为正增益:
```
Q_swarm > Q_single ∧ Q_swarm > Q_strong ∧ Q_swarm > Q_chain ∧ Q_swarm > Q_sub
```
否则蜂群不成立(仅是「多 Agent 工作流」而非有涌现的蜂群)。
> 仅有原始增益不足以验收:还须经成本归一化(见 [`cost-normalized-gain.md`](./cost-normalized-gain.md)),证明增益非「堆 Agent / Token」虚高。
## 3. Q(质量)口径
`Q` 采用统一质量度量。建议复用标准 §5.3:
```
Q = Q_quality = 0.4·TestPassRate + 0.3·CodeReviewScore + 0.3·UserAcceptance
```
并在每组统一采集 `Completion / Quality / Cost / Time / Robustness`(标准 §10),按场景(Coding / Refactoring / Architecture / DevOps / Bug Fix)分别计算 `G_E`。
> ⚠️ `Q` 的精确口径(是否等于 `Q_quality`,或综合 Completion/Robustness)v2.0 未唯一指定 → 待对齐。
## 4. 评测流程(草案)
1. 固定任务集(按场景)。
2. 在 A/B/C/D 与 Swarm 上**同一任务集**运行,统一采集指标(见 swarm-metrics-schema §0)。
3. 计算每场景 `Q_*`,得 `G_E = Q_swarm − Q_base`。
4. 进入成本归一化(`G_E,c`)。
5. 多次运行取均值并报告方差/显著性。
## 5. 实现状态
| 组件 | 位置(规划) | 状态 |
|---|---|---|
| 基线运行器 A–D | `benchmark/baselines/` | 🔴 未实现 |
| 基线 benchmark 套件 / 数据集 | `benchmark/baselines/` + `test-data/` | 🔴 未实现 |
| 基线对比 | baseline-comparison | 🔴 未实现 |
| 涌现评估器(G_E) | `benchmark/` | 🔴 未实现 |
| 归一化增益评估器(G_E,c) | cost-normalized-gain | 🔴 未实现 |
> 在以上落地前,**不得宣称已验证蜂群涌现能力**(重大能力缺口)。
## 6. 待对齐
- `Q` 的唯一口径。
- 四类基线的标准实现(尤其 Strong Agent / Chain Agent / Sub-Agent 的定义边界)与统一数据集。
- 运行次数、方差/显著性门槛。