feat(benchmark): 落地自证采集器(阶段0+1)— S_gain≡G_E 接通 S_swarm + leaderboard
阶段0(定口径,docs/benchmark/emergence-evaluation.md §6 v2.1-impl): - S_gain ≡ G_E(差值,不强制归一 [0,100],与标准「见涌现增益」字面一致)。 - 聚合 S_gain 取对最强基线(Q_base 最大)的 G_E(最保守,避免挑弱基线虚高)。 - Q ≡ Q_quality;swarm_valid 仍要求对全部基线 G_E>0 且 G_E,c>0。 阶段1(采集器): - 新增 benchmark/collectors/selfcert_collector.py:把套件 5 份 BenchmarkRunRecord (swarm+4基线)+ 可选活体 SwarmMetrics 合流,经 baselines.compare 算 G_E/G_E,c, 补全 run_collector 无法自算的 s_gain/g_e/g_e_cost/s_swarm,可能时产出 Benchmark_Agent。 - benchmark/leaderboard:实现排行榜聚合+渲染(标准 §11 字段)。 - run-benchmark-suite.py 接入自证 + leaderboard 输出。 诚实纪律(组织规则 #9):缺真实输入一律 NaN+coverage False,不伪造。 - O(可观测性)标准无公式 → 恒 NaN;Gov 计数器未实现 → 无活体治理则 NaN。 - 故完整 Benchmark_Agent 数字仍待 O 公式 + Gov 计数器(阶段2),采集器明列缺口。 验证:新增 test-benchmark-selfcert.py(17 项)+ 现有 benchmark 测试(metrics/ collector/comparison/runners)+ offline suite + 契约冒烟(runtime/merge/freeze)全 PASS。 影响范围:仅 agent_swarm benchmark 模块 + docs;不改 Manager↔Swarm 契约/计费/审计/密钥/发布链路。 Co-Authored-By: Claude Opus 4.8 (1M context) <noreply@anthropic.com>
This commit is contained in:
co-authored by
Claude Opus 4.8
parent
b83638a475
commit
b5cc68c977
@@ -61,8 +61,19 @@ Q = Q_quality = 0.4·TestPassRate + 0.3·CodeReviewScore + 0.3·UserAcceptance
|
||||
|
||||
> 在以上落地前,**不得宣称已验证蜂群涌现能力**(重大能力缺口)。
|
||||
|
||||
## 6. 待对齐
|
||||
## 6. 实现口径(v2.1-impl,2026-06-12 落地自证采集器时锁定)
|
||||
|
||||
标准 §5.1 写 `S_gain` 「见第 6 节涌现增益」,但未给从 `G_E`(差值)到 `S_swarm` 分量的换算。落地采集器(`benchmark/collectors/selfcert_collector.py`)按以下口径执行,**不引入标准外的归一化/魔法系数**:
|
||||
|
||||
- **`S_gain ≡ G_E`**:直接取涌现增益值。`S_swarm` 的若干分量(`V_speed`/`E_cost`/`S_cost`)本就可超过 100,故 `S_gain` 不强制归一到 `[0,100]`,与标准字面「见涌现增益」一致。
|
||||
- **聚合基线 = 最强基线**:当对 4 类基线分别得 `G_E_i` 时,进入 `S_swarm` 的单一 `S_gain` 取**对最强基线**(`Q_base` 最大者)的 `G_E`,即 `min_i G_E_i`——最保守口径,避免挑弱基线虚高。逐基线 `G_E_i / G_E,c_i` 仍全量保留在 leaderboard。
|
||||
- **`Q ≡ Q_quality`**(标准 §5.3,掩码归一见 `swarm-metrics-schema §4`):与 §3 一致。
|
||||
- **成立硬条件不变**:`swarm_valid` 要求对**全部**基线 `G_E>0 且 G_E,c>0`(见 §2 与 `baselines.evaluate`)。
|
||||
|
||||
> ⚠️ 该口径为**实现级裁定**,已与 owner 对齐(「标准见 docs/benchmark/,S_gain 见涌现增益」)。若后续标准 v2.x 给出不同换算,以标准为准并同步本节。
|
||||
|
||||
## 7. 待对齐
|
||||
|
||||
- `Q` 的唯一口径。
|
||||
- 四类基线的标准实现(尤其 Strong Agent / Chain Agent / Sub-Agent 的定义边界)与统一数据集。
|
||||
- 运行次数、方差/显著性门槛。
|
||||
- `Benchmark_Agent` 仍缺两分量:`O`(可观测性,标准无公式)、`Gov`(计数器未实现,见 governance-score.md)——采集器对二者诚实置 `NaN + coverage=False`,故完整 `Benchmark_Agent` 数字待这两项落地。
|
||||
|
||||
Reference in New Issue
Block a user