- 基准标准 v2.1:SwarmMetrics(15 字段)、τ/η/P_decision/reward 公式、对称 G_E,c(修正 C_base=1.0 退化)、Σλ=1.0 校验;新增基线对比与运行记录 schema;指标覆盖缺口分析;参考系数暂留为元数据(待量化)。 - 主控 Agent 实体(分解 / 评审决策 / 汇总);事件契约修正(timeline.title、budget.threshold_pct、handoff 角色、task.released)+ 契约校验脚本。 - 实质性 LLM 对等回复(含降级回退);集成契约(runtime / event / usage / audit / frontend / capability / security);CLIENT_GUIDE 客户端指南;CI 工作流;治理与交付文档。 Co-Authored-By: Claude Opus 4.8 (1M context) <noreply@anthropic.com>
2.7 KiB
2.7 KiB
Governance Score(治理评分)
状态:规划中(公式已对齐,治理计数器未落地)。
依据:Agent 蜂群指标量化与标准 v2.0 §4.1, §5.1(公式未变)。配套:
security-boundary、audit-trace、swarm-metrics-schema.md。
1. 公式
G_gov = CompliantActions / SensitiveActions × 100 # 执行层(奖励 R 中 w₆=0.10)
S_governance = CompliantOperations / TotalOperations × 100 # 蜂群层(S_swarm 中 0.10)
Gov(综合治理能力,进入 Benchmark_Agent)由上述构成。
2. 何为「需治理 / 合规」操作
需纳入治理计数的操作类别(对齐 security-boundary):
- 审批门:高危操作是否走客户端审批(
approval.requested→ 审批回执)。 - 权限:资源访问是否在
allowed_actions/constraints范围内。 - 密钥:是否仅用
secret_ref、无明文泄露。 - MCP / 工具边界:工具调用是否在允许集合内(
sk_tool.*)。 - 敏感操作:生产部署、DB 写、外部 API 等是否满足策略与 TTL。
- 审计:是否产生可追溯记录(见 audit-trace)。
「合规」= 上述操作满足策略;S_governance = 合规操作数 / 总(敏感/受治理)操作数。
3. 本仓可采集状态
| 治理维度 | 现状 |
|---|---|
| 审批门(waiting_approval + approvals 回执) | 🟡 状态机已实现,但未计数「合规/总」 |
密钥(azkv:// 强校验、明文拒绝、脱敏) |
🟡 已强制,但未作为治理计数项 |
| 权限(allowed_actions/constraints 运行时强制) | 🔴 未运行时强制(见 security-boundary §3) |
| MCP / 工具边界 | 🔴 未实现(无工具权限引擎) |
| 敏感操作策略 + TTL 校验 | 🔴 未实现(审批逐项校验待加强) |
| 审计可追溯 | 🟡 事件流可追溯,未量化为治理分 |
结论:治理当前仍偏 README/机制级,缺少
CompliantOperations / TotalOperations的统一计数与导出 →S_governance/Gov暂不可量化输出。
4. 实现状态
| 组件 | 状态 |
|---|---|
| 治理操作计数器(governed/compliant/total) | 🔴 未实现 |
| 治理评分导出(S_governance / Gov) | 🔴 未实现 |
| 与 audit 事件的绑定 | 🔴 未实现 |
5. 待对齐
- 「敏感 / 受治理操作」的精确清单与判定(Security/Governance Team)。
- 「合规」判定规则(策略命中、审批命中、范围内、TTL 内)。
- 计数与导出口径(按
swarm_id聚合,进入SwarmMetrics.governance)。