- 基准标准 v2.1:SwarmMetrics(15 字段)、τ/η/P_decision/reward 公式、对称 G_E,c(修正 C_base=1.0 退化)、Σλ=1.0 校验;新增基线对比与运行记录 schema;指标覆盖缺口分析;参考系数暂留为元数据(待量化)。 - 主控 Agent 实体(分解 / 评审决策 / 汇总);事件契约修正(timeline.title、budget.threshold_pct、handoff 角色、task.released)+ 契约校验脚本。 - 实质性 LLM 对等回复(含降级回退);集成契约(runtime / event / usage / audit / frontend / capability / security);CLIENT_GUIDE 客户端指南;CI 工作流;治理与交付文档。 Co-Authored-By: Claude Opus 4.8 (1M context) <noreply@anthropic.com>
9 lines
405 B
Python
9 lines
405 B
Python
"""Agent Swarm benchmark package.
|
|
|
|
实现状态(见 docs/benchmark/swarm-benchmark-protocol.md §6):
|
|
- metrics.py:指标公式(纯函数,已实现、可测)+ SwarmMetrics 数据类。
|
|
- collectors/ baselines/ replay/ leaderboard/:骨架,数据采集与基线运行**未落地**。
|
|
|
|
在采集器与基线运行器落地前,不得宣称本仓具备 Agent Swarm 量化自证能力。
|
|
"""
|