Files
fengqun/docs/INDUSTRY_STANDARD_AGNET_TEST_PLAN.zh-CN.md
T
gongzhiyongandOmX a4d771ede5 Define numeric swarm acceptance gates
Add a concrete 0-100 swarmness/compliance score, local large-scale stress, and 3000 TPM budget acceptance so the repo can say when it is a swarm by measured criteria instead of prose alone.

Constraint: user required Chinese docs, explicit scenarios, parameters, formulas, pass/fail lines, and git upload.

Rejected: prose-only PASS reports | they did not answer whether the system is a swarm with a concrete score.

Confidence: high

Scope-risk: moderate

Directive: keep production runtime claims separate from local minimal swarm acceptance scores.

Tested: py_compile swarm_minimal examples tests; unittest discover -s tests 45 tests; run_swarm_compliance_score.py; run_tpm_budget_acceptance.py; run_academic_standard_evaluation.py; git diff --check; docs/script secret-pattern scan.

Not-tested: live S07 and production Kubernetes/NewAPI provider-rate-limit stress were not rerun in this upload step.

Co-authored-by: OmX <omx@oh-my-codex.dev>
2026-05-17 18:19:24 +08:00

67 lines
4.5 KiB
Markdown
Raw Blame History

This file contains ambiguous Unicode characters
This file contains Unicode characters that might be confused with other characters. If you think that this is intentional, you can safely ignore this warning. Use the Escape button to reveal them.
# Agent 行业参考标准映射
当前行业没有统一的 “Agnet/Agent 质量认证标准”。本项目不再用普通软件产品质量标准作为主标准,而是采用:
- `AGENT_SWARM_QUALITY_STANDARD.zh-CN.md`:主标准,定义通用 Agent 质量标准 AQS 和蜂群 Agent 质量标准 SW-AQS。
- `ACADEMIC_STANDARD_TEST_REPORT.zh-CN.md`:执行报告,记录本轮测试过程、结果、算法和马尔可夫过程判定。
- `MODEL_AGNET_IO_REPORT.zh-CN.md`:输入输出报告,记录模型任务、prompt 结构、实际输出和接手机制。
## 行业参考框架
| 来源 | 在本项目中的用途 |
| --- | --- |
| NIST AI RMF 1.0 | 管理 Agent 风险、可控性、可度量性和治理闭环 |
| NIST AI 600-1 | 处理生成式 AI 的幻觉、隐私、信息安全、组件集成和预部署测试 |
| OWASP LLM Top 10 | 覆盖 prompt injection、敏感信息泄露、过度代理、不安全输出处理、过度信任 |
| OWASP Agentic Skills Top 10 | 覆盖 Agent 工具/技能执行层的权限、隔离、审计和运行时安全 |
| MITRE ATLAS | 从对抗性 AI 和误用角度设计失败、越权、诱导和异常场景 |
| OpenTelemetry | 约束 run_id、task、event、metric、log、artifact 等可观测证据 |
| LangGraph handoff | 参考 active-agent 和 `transfer_to_<agent>` 式交接语义 |
| 蜂群六特征归纳标准 | 约束去中心化、自组织、涌现性、鲁棒性、可扩展性和隐式协作 |
## 指标落地方式
行业框架只提供方向,不直接给本项目可执行阈值。因此本项目把框架要求落成 `AGENT_SWARM_INDICATOR_TEST_MATRIX.zh-CN.md` 中的可测指标:
| 来源方向 | 本项目指标 | 设计场景 | 成功值 |
| --- | --- | --- | --- |
| NIST 风险可度量 | AQS-01 到 AQS-13 | S07 外部 FastAPI 代码链、质量门、fallback、报告审计 | 7/7 STEP 可承接;质量 `Q >= 0.72`;明显密钥样式命中数 `0` |
| OWASP 工具与密钥边界 | AQS-06 / AQS-07 | 依赖边界测试、Markdown/报告密钥样式扫描 | NATS/Cosmos 不能成为必需依赖;报告不输出真实长期密钥 |
| OpenTelemetry 可观测 | AQS-08 / SW-AQS-08 | PostgreSQL task、Redis event、Blob artifact、shared_state edge | S07 14 项 checks 全 PASS;event delta 至少 `3*7+1=22` |
| LangGraph handoff | AQS-03 / SW-AQS-07 | STEP 链路和 active-agent handoff | 7/7 输出包含 previous marker;handoff payload 保留 |
| 蜂群六特征 | F01-F06 / S10 | 本地六特征验收 | 6 项全部 PASS,任一失败则 S10 失败 |
## 最小通过条件
本项目当前最小通过条件不是“代码质量通过”,而是:
1. AQS 通用 Agent 标准中,任务理解、上下文、模型选择、资源边界、敏感信息、可观测性、错误可解释、交接准备度均有证据。
2. SW-AQS 蜂群 Agent 标准中,任务池、共享状态、信息素、handoff、事件流、质量门、fallback 补救、多轮质量共识、候选融合、并发 claim、收敛,以及去中心化、自组织、涌现性、鲁棒性、可扩展性、隐式协作六特征均有证据。
3. 模型输入输出能被审计:知道每个 Agent 被分配了什么任务、收到了什么输入、输出了什么、下一个 Agent 如何接手。
4. live 测试真实连接 Azure PostgreSQL、Redis、Blob 和 NewAPI,且不输出任何真实密钥。
5. 模型拒答、角色拒绝、偏题或目标漂移不能直接通过,必须被扣分并进入重试、换模型或质量共识门。
最新一次标准矩阵已经扩展为 S01-S10,S10 六特征本地验收已通过。以下为 S07 外部 GitHub live 证据:
```json
{
"run_id": "9c7ccc6087c1435694a52efb12c32301",
"target_repo": "fastapi/fastapi",
"target_commit": "ecace740f3eaccb1aba152cf1de79477095c56f4",
"completed_tasks": 7,
"accepted_score": 1.0,
"check_count": 14,
"quality_consensus_rounds": 2,
"failed_checks": []
}
```
## 保留缺口
当前满足“最小蜂群 Agent 质量标准 v1”,而且 S09 已补齐 3/5/7 并发 claim、候选融合和互相质询的本地最小代码验收,S10 已把去中心化、自组织、涌现性、鲁棒性、可扩展性、隐式协作固定为一级验收门。但它还不是完整生产级蜂群平台认证,仍需补:
- 真实 Kubernetes / worker runtime 下的 3/5/7 扩缩容压测,而不只是内存确定性压测。
- Redis Stream 事件被其他 Agent 消费并改变决策。
- 自动创建补充 Agnet / 动态任务图,而不只是当前候选的反驳、修正和再投票。
- 收敛速度、Agent 利用率、响应时间、信息素分布等统一 metrics。