Add a concrete 0-100 swarmness/compliance score, local large-scale stress, and 3000 TPM budget acceptance so the repo can say when it is a swarm by measured criteria instead of prose alone. Constraint: user required Chinese docs, explicit scenarios, parameters, formulas, pass/fail lines, and git upload. Rejected: prose-only PASS reports | they did not answer whether the system is a swarm with a concrete score. Confidence: high Scope-risk: moderate Directive: keep production runtime claims separate from local minimal swarm acceptance scores. Tested: py_compile swarm_minimal examples tests; unittest discover -s tests 45 tests; run_swarm_compliance_score.py; run_tpm_budget_acceptance.py; run_academic_standard_evaluation.py; git diff --check; docs/script secret-pattern scan. Not-tested: live S07 and production Kubernetes/NewAPI provider-rate-limit stress were not rerun in this upload step. Co-authored-by: OmX <omx@oh-my-codex.dev>
6.1 KiB
6.1 KiB
最小闭环完成度对照清单
对象: swarm-minimal 最小蜂群原型
结论: 当前已经达到本仓库定义的最小可验收闭环,并且已把原先 1-2 天可补的三项边界补成代码级最小验收。该结论仍不等于完整生产级蜂群平台认证。
已完成的最小闭环
| 项 | 当前证据 |
|---|---|
| 本地静态门 | py_compile swarm_minimal/*.py examples/*.py tests/*.py 通过 |
| 单元与确定性场景 | unittest discover -s tests 通过,当前为 45 项测试 |
| 学术化本地门禁 | run_academic_standard_evaluation.py 覆盖 A01-A09 |
| 完整标准矩阵 | run_standard_scenario_acceptance.py 覆盖 S01-S10 |
| live 外部代码场景 | S07 对 fastapi/fastapi 固定 commit 跑通 7 步 Agnet 链 |
| 蜂群六特征 | S10 覆盖去中心化、自组织、涌现性、鲁棒性、可扩展性、隐式协作 |
| 蜂群性数值 | swarmness_score=100/100,minimal_compliance_score=100/100 |
| 本机最大性能压力 | L01 使用 8 逻辑核、128 Agent、131072 任务完成本地大规模压力验收 |
| 3000 TPM 模型预算 | L02 使用 8 个 Agent、60 个预算任务打满 3000 token 单分钟窗口,且不超额 |
| 质量门 | 拒答、角色拒绝、偏题、本仓库漂移、交接断裂会被扣分和补救 |
| fallback 补救 | 当前模型输出不合格时先重试,再切换 fallback 模型接手当前步骤 |
| 多轮质量共识 | S07 已有交接连续性、输出质量、最终收敛三类审查 Agnet 的 2 轮共识 |
| 马尔可夫式状态机 | 给定完整任务、信息素、共享状态、观测和 agent policy,工程转移由当前状态决定 |
最小闭环成功阈值
详细指标矩阵见 AGENT_SWARM_INDICATOR_TEST_MATRIX.zh-CN.md。当前“最小闭环已完成”只在下面阈值同时满足时成立:
| 指标组 | 成功值 |
|---|---|
| 本地门禁 | py_compile 退出码 0;unittest discover 当前 45 项全部通过 |
| 学术化门禁 | A01-A09 全部 PASS |
| 完整标准矩阵 | S01-S10 全部 PASS |
| S07 live 外部代码链 | 7 个任务完成、14 项检查全 PASS、失败检查数 0、质量共识轮数 >=2 |
| S09 三项边界 | 3/5/7 Agent 并发 claim 无重复领取;候选融合过滤低分噪声;互相质询至少 2 轮后接受 |
| S10 六特征 | 去中心化、自组织、涌现性、鲁棒性、可扩展性、隐式协作六项全部 PASS |
| 蜂群性评分 | swarmness_score>=75 才能声称最小蜂群成立;当前 100;F01-F06 任一失败时总分最高 59 |
| L01 本机压力 | completed_tasks=131072、failed_tasks=0、duplicate_claims=0、participating_agents=128、converged_shards=8 |
| L02 3000 TPM | target_tpm=3000、total_reserved_tokens=3000、max_tokens_in_any_minute=3000、budget_utilization=1.0、failed_tasks=0、duplicate_claims=0 |
| 密钥安全 | Markdown / 报告中明显密钥样式命中数 0 |
已补的三项边界
| 优先级 | 原缺口 | 已补最小实现 | 验收标准 |
|---|---|---|---|
| P1 | SW-AQS-16:3/5/7 Agent 并发自主 claim 与本地扩缩容最小压测 | SwarmCoordinator.run_autonomous_until_converged 使用加锁 task pool 让 3/5/7 个 Agent 并发 claim;S09 覆盖 6/10/14 个任务 |
所有任务完成、无重复 claim、无失败任务、每个 Agent 至少参与一次、最终收敛 |
| P2 | 候选融合:从最高分候选升级为多个候选输出融合 | fuse_candidate_outputs 和 converge_fused 支持按分数过滤、去重合并多个有效候选 |
低分噪声被过滤;多个高分候选的有效结论保留;source candidate 可审计 |
| P3 | 更真实的互相质询:从规则/投票门升级为反驳、修正、再投票 | QuestioningConsensusSwarm 增加 challenge、revise、vote 三段式回合 |
第一轮不允许直接收敛;必须产生质询和修正;第二轮或之后再投票接受 |
测试标准
本轮仍按 AQS / SW-AQS v1 判断,不按普通软件质量标准判断。核心标准来自:
- NIST AI RMF / NIST AI 600-1:风险、可控性、可度量性、生成式 AI 失败模式。
- OWASP LLM Top 10 / OWASP Agentic Skills Top 10:敏感信息、过度代理、工具边界、运行时安全。
- MITRE ATLAS:失败、诱导、误用和恢复场景。
- OpenTelemetry:run、task、event、artifact、metric 的可观测证据。
- LangGraph handoff 参考:active-agent 和上下文交接语义。
- 本项目 SW-AQS:任务池、共享状态、信息素、handoff、事件、质量门、fallback、共识、扩缩容和收敛。
本轮新增 S09,专门验收三个边界:
sw_aqs_16_scaled_autonomous_claim_3_5_7candidate_fusion_outputquestion_revise_revote_consensus
本轮新增 S10,专门验收六个蜂群一级特征:
decentralization_no_single_agent_control_nodeself_organization_from_local_interactionsemergence_global_result_exceeds_single_signalrobustness_single_agent_failure_isolatedscalability_three_five_seven_agents_same_architectureimplicit_collaboration_by_environment
本轮新增 L01 / L02,专门把本机规模和模型预算量级纳入验收:
local_large_scale_stress: 使用本机 8 逻辑核、128 Agent、131072 任务验证本地大规模 claim / 执行 / 收敛稳定性。local_3000_tpm_budget: 使用 8 个 Agent、60 个预算任务、每任务 50 token,验证 3000 TPM 窗口内不超额且利用率打满。
仍不是生产级完整交付的部分
当前补齐的是本地确定性、最小代码级验收。以下仍属于更大范围平台阶段:
- Manager / Agnet 平台统一接口、人类审批主线、权限、预算和审计全链路。
- 真实 Kubernetes runtime 的 3/5/7 worker 扩缩容压测。
- 真实 NewAPI / 模型供应商侧 3000 TPM live 限流、429 重试、费用归因和长期运行曲线。
- Redis Stream 事件被其他 Agent 实时消费并影响下一步任务图。
- 自动创建补充 Agnet / 动态任务图,而不是只在当前候选上质询和修正。
- 收敛速度、Agent 利用率、响应时间、信息素分布等生产监控指标。