Files
Agentswarm/docs/benchmark/governance-score.md
Songhaoz666andClaude Opus 4.8 54cb327348 Agent Swarm v6:基准 v2.1、主控 Agent、实质性对等回复、客户端指南
- 基准标准 v2.1:SwarmMetrics(15 字段)、τ/η/P_decision/reward 公式、对称 G_E,c(修正 C_base=1.0 退化)、Σλ=1.0 校验;新增基线对比与运行记录 schema;指标覆盖缺口分析;参考系数暂留为元数据(待量化)。
- 主控 Agent 实体(分解 / 评审决策 / 汇总);事件契约修正(timeline.title、budget.threshold_pct、handoff 角色、task.released)+ 契约校验脚本。
- 实质性 LLM 对等回复(含降级回退);集成契约(runtime / event / usage / audit / frontend / capability / security);CLIENT_GUIDE 客户端指南;CI 工作流;治理与交付文档。

Co-Authored-By: Claude Opus 4.8 (1M context) <noreply@anthropic.com>
2026-06-09 16:21:18 +08:00

2.7 KiB
Raw Permalink Blame History

Governance Score(治理评分)

状态:规划中(公式已对齐,治理计数器未落地)。

依据:Agent 蜂群指标量化与标准 v2.0 §4.1, §5.1(公式未变)。配套:security-boundary、audit-trace、swarm-metrics-schema.md。

1. 公式

G_gov        = CompliantActions / SensitiveActions × 100      # 执行层(奖励 R 中 w₆=0.10)
S_governance = CompliantOperations / TotalOperations × 100    # 蜂群层(S_swarm 中 0.10)

Gov(综合治理能力,进入 Benchmark_Agent)由上述构成。

2. 何为「需治理 / 合规」操作

需纳入治理计数的操作类别(对齐 security-boundary):

  • 审批门:高危操作是否走客户端审批(approval.requested → 审批回执)。
  • 权限:资源访问是否在 allowed_actions/constraints 范围内。
  • 密钥:是否仅用 secret_ref、无明文泄露。
  • MCP / 工具边界:工具调用是否在允许集合内(sk_tool.*)。
  • 敏感操作:生产部署、DB 写、外部 API 等是否满足策略与 TTL。
  • 审计:是否产生可追溯记录(见 audit-trace)。

「合规」= 上述操作满足策略;S_governance = 合规操作数 / 总(敏感/受治理)操作数。

3. 本仓可采集状态

治理维度 现状
审批门(waiting_approval + approvals 回执) 🟡 状态机已实现,但未计数「合规/总」
密钥(azkv:// 强校验、明文拒绝、脱敏) 🟡 已强制,但未作为治理计数项
权限(allowed_actions/constraints 运行时强制) 🔴 未运行时强制(见 security-boundary §3)
MCP / 工具边界 🔴 未实现(无工具权限引擎)
敏感操作策略 + TTL 校验 🔴 未实现(审批逐项校验待加强)
审计可追溯 🟡 事件流可追溯,未量化为治理分

结论:治理当前仍偏 README/机制级,缺少 CompliantOperations / TotalOperations 的统一计数与导出 → S_governance / Gov 暂不可量化输出。

4. 实现状态

组件 状态
治理操作计数器(governed/compliant/total) 🔴 未实现
治理评分导出(S_governance / Gov) 🔴 未实现
与 audit 事件的绑定 🔴 未实现

5. 待对齐

  • 「敏感 / 受治理操作」的精确清单与判定(Security/Governance Team)。
  • 「合规」判定规则(策略命中、审批命中、范围内、TTL 内)。
  • 计数与导出口径(按 swarm_id 聚合,进入 SwarmMetrics.governance)。