Files
fengqun/docs/INDUSTRY_STANDARD_AGNET_TEST_PLAN.zh-CN.md
T
gongzhiyongandOmX a4d771ede5 Define numeric swarm acceptance gates
Add a concrete 0-100 swarmness/compliance score, local large-scale stress, and 3000 TPM budget acceptance so the repo can say when it is a swarm by measured criteria instead of prose alone.

Constraint: user required Chinese docs, explicit scenarios, parameters, formulas, pass/fail lines, and git upload.

Rejected: prose-only PASS reports | they did not answer whether the system is a swarm with a concrete score.

Confidence: high

Scope-risk: moderate

Directive: keep production runtime claims separate from local minimal swarm acceptance scores.

Tested: py_compile swarm_minimal examples tests; unittest discover -s tests 45 tests; run_swarm_compliance_score.py; run_tpm_budget_acceptance.py; run_academic_standard_evaluation.py; git diff --check; docs/script secret-pattern scan.

Not-tested: live S07 and production Kubernetes/NewAPI provider-rate-limit stress were not rerun in this upload step.

Co-authored-by: OmX <omx@oh-my-codex.dev>
2026-05-17 18:19:24 +08:00

4.5 KiB
Raw Blame History

Agent 行业参考标准映射

当前行业没有统一的 “Agnet/Agent 质量认证标准”。本项目不再用普通软件产品质量标准作为主标准,而是采用:

  • AGENT_SWARM_QUALITY_STANDARD.zh-CN.md:主标准,定义通用 Agent 质量标准 AQS 和蜂群 Agent 质量标准 SW-AQS。
  • ACADEMIC_STANDARD_TEST_REPORT.zh-CN.md:执行报告,记录本轮测试过程、结果、算法和马尔可夫过程判定。
  • MODEL_AGNET_IO_REPORT.zh-CN.md:输入输出报告,记录模型任务、prompt 结构、实际输出和接手机制。

行业参考框架

来源 在本项目中的用途
NIST AI RMF 1.0 管理 Agent 风险、可控性、可度量性和治理闭环
NIST AI 600-1 处理生成式 AI 的幻觉、隐私、信息安全、组件集成和预部署测试
OWASP LLM Top 10 覆盖 prompt injection、敏感信息泄露、过度代理、不安全输出处理、过度信任
OWASP Agentic Skills Top 10 覆盖 Agent 工具/技能执行层的权限、隔离、审计和运行时安全
MITRE ATLAS 从对抗性 AI 和误用角度设计失败、越权、诱导和异常场景
OpenTelemetry 约束 run_id、task、event、metric、log、artifact 等可观测证据
LangGraph handoff 参考 active-agent 和 transfer_to_<agent> 式交接语义
蜂群六特征归纳标准 约束去中心化、自组织、涌现性、鲁棒性、可扩展性和隐式协作

指标落地方式

行业框架只提供方向,不直接给本项目可执行阈值。因此本项目把框架要求落成 AGENT_SWARM_INDICATOR_TEST_MATRIX.zh-CN.md 中的可测指标:

来源方向 本项目指标 设计场景 成功值
NIST 风险可度量 AQS-01 到 AQS-13 S07 外部 FastAPI 代码链、质量门、fallback、报告审计 7/7 STEP 可承接;质量 Q >= 0.72;明显密钥样式命中数 0
OWASP 工具与密钥边界 AQS-06 / AQS-07 依赖边界测试、Markdown/报告密钥样式扫描 NATS/Cosmos 不能成为必需依赖;报告不输出真实长期密钥
OpenTelemetry 可观测 AQS-08 / SW-AQS-08 PostgreSQL task、Redis event、Blob artifact、shared_state edge S07 14 项 checks 全 PASS;event delta 至少 3*7+1=22
LangGraph handoff AQS-03 / SW-AQS-07 STEP 链路和 active-agent handoff 7/7 输出包含 previous marker;handoff payload 保留
蜂群六特征 F01-F06 / S10 本地六特征验收 6 项全部 PASS,任一失败则 S10 失败

最小通过条件

本项目当前最小通过条件不是“代码质量通过”,而是:

  1. AQS 通用 Agent 标准中,任务理解、上下文、模型选择、资源边界、敏感信息、可观测性、错误可解释、交接准备度均有证据。
  2. SW-AQS 蜂群 Agent 标准中,任务池、共享状态、信息素、handoff、事件流、质量门、fallback 补救、多轮质量共识、候选融合、并发 claim、收敛,以及去中心化、自组织、涌现性、鲁棒性、可扩展性、隐式协作六特征均有证据。
  3. 模型输入输出能被审计:知道每个 Agent 被分配了什么任务、收到了什么输入、输出了什么、下一个 Agent 如何接手。
  4. live 测试真实连接 Azure PostgreSQL、Redis、Blob 和 NewAPI,且不输出任何真实密钥。
  5. 模型拒答、角色拒绝、偏题或目标漂移不能直接通过,必须被扣分并进入重试、换模型或质量共识门。

最新一次标准矩阵已经扩展为 S01-S10,S10 六特征本地验收已通过。以下为 S07 外部 GitHub live 证据:

{
  "run_id": "9c7ccc6087c1435694a52efb12c32301",
  "target_repo": "fastapi/fastapi",
  "target_commit": "ecace740f3eaccb1aba152cf1de79477095c56f4",
  "completed_tasks": 7,
  "accepted_score": 1.0,
  "check_count": 14,
  "quality_consensus_rounds": 2,
  "failed_checks": []
}

保留缺口

当前满足“最小蜂群 Agent 质量标准 v1”,而且 S09 已补齐 3/5/7 并发 claim、候选融合和互相质询的本地最小代码验收,S10 已把去中心化、自组织、涌现性、鲁棒性、可扩展性、隐式协作固定为一级验收门。但它还不是完整生产级蜂群平台认证,仍需补:

  • 真实 Kubernetes / worker runtime 下的 3/5/7 扩缩容压测,而不只是内存确定性压测。
  • Redis Stream 事件被其他 Agent 消费并改变决策。
  • 自动创建补充 Agnet / 动态任务图,而不只是当前候选的反驳、修正和再投票。
  • 收敛速度、Agent 利用率、响应时间、信息素分布等统一 metrics。