Files
fengqun/docs/MINIMAL_CLOSED_LOOP_STATUS.zh-CN.md
gongzhiyongandOmX a4d771ede5 Define numeric swarm acceptance gates
Add a concrete 0-100 swarmness/compliance score, local large-scale stress, and 3000 TPM budget acceptance so the repo can say when it is a swarm by measured criteria instead of prose alone.

Constraint: user required Chinese docs, explicit scenarios, parameters, formulas, pass/fail lines, and git upload.

Rejected: prose-only PASS reports | they did not answer whether the system is a swarm with a concrete score.

Confidence: high

Scope-risk: moderate

Directive: keep production runtime claims separate from local minimal swarm acceptance scores.

Tested: py_compile swarm_minimal examples tests; unittest discover -s tests 45 tests; run_swarm_compliance_score.py; run_tpm_budget_acceptance.py; run_academic_standard_evaluation.py; git diff --check; docs/script secret-pattern scan.

Not-tested: live S07 and production Kubernetes/NewAPI provider-rate-limit stress were not rerun in this upload step.

Co-authored-by: OmX <omx@oh-my-codex.dev>
2026-05-17 18:19:24 +08:00

6.1 KiB
Raw Permalink Blame History

最小闭环完成度对照清单

对象: swarm-minimal 最小蜂群原型
结论: 当前已经达到本仓库定义的最小可验收闭环,并且已把原先 1-2 天可补的三项边界补成代码级最小验收。该结论仍不等于完整生产级蜂群平台认证。

已完成的最小闭环

项 当前证据
本地静态门 py_compile swarm_minimal/*.py examples/*.py tests/*.py 通过
单元与确定性场景 unittest discover -s tests 通过,当前为 45 项测试
学术化本地门禁 run_academic_standard_evaluation.py 覆盖 A01-A09
完整标准矩阵 run_standard_scenario_acceptance.py 覆盖 S01-S10
live 外部代码场景 S07 对 fastapi/fastapi 固定 commit 跑通 7 步 Agnet 链
蜂群六特征 S10 覆盖去中心化、自组织、涌现性、鲁棒性、可扩展性、隐式协作
蜂群性数值 swarmness_score=100/100,minimal_compliance_score=100/100
本机最大性能压力 L01 使用 8 逻辑核、128 Agent、131072 任务完成本地大规模压力验收
3000 TPM 模型预算 L02 使用 8 个 Agent、60 个预算任务打满 3000 token 单分钟窗口,且不超额
质量门 拒答、角色拒绝、偏题、本仓库漂移、交接断裂会被扣分和补救
fallback 补救 当前模型输出不合格时先重试,再切换 fallback 模型接手当前步骤
多轮质量共识 S07 已有交接连续性、输出质量、最终收敛三类审查 Agnet 的 2 轮共识
马尔可夫式状态机 给定完整任务、信息素、共享状态、观测和 agent policy,工程转移由当前状态决定

最小闭环成功阈值

详细指标矩阵见 AGENT_SWARM_INDICATOR_TEST_MATRIX.zh-CN.md。当前“最小闭环已完成”只在下面阈值同时满足时成立:

指标组 成功值
本地门禁 py_compile 退出码 0;unittest discover 当前 45 项全部通过
学术化门禁 A01-A09 全部 PASS
完整标准矩阵 S01-S10 全部 PASS
S07 live 外部代码链 7 个任务完成、14 项检查全 PASS、失败检查数 0、质量共识轮数 >=2
S09 三项边界 3/5/7 Agent 并发 claim 无重复领取;候选融合过滤低分噪声;互相质询至少 2 轮后接受
S10 六特征 去中心化、自组织、涌现性、鲁棒性、可扩展性、隐式协作六项全部 PASS
蜂群性评分 swarmness_score>=75 才能声称最小蜂群成立;当前 100;F01-F06 任一失败时总分最高 59
L01 本机压力 completed_tasks=131072、failed_tasks=0、duplicate_claims=0、participating_agents=128、converged_shards=8
L02 3000 TPM target_tpm=3000、total_reserved_tokens=3000、max_tokens_in_any_minute=3000、budget_utilization=1.0、failed_tasks=0、duplicate_claims=0
密钥安全 Markdown / 报告中明显密钥样式命中数 0

已补的三项边界

优先级 原缺口 已补最小实现 验收标准
P1 SW-AQS-16:3/5/7 Agent 并发自主 claim 与本地扩缩容最小压测 SwarmCoordinator.run_autonomous_until_converged 使用加锁 task pool 让 3/5/7 个 Agent 并发 claim;S09 覆盖 6/10/14 个任务 所有任务完成、无重复 claim、无失败任务、每个 Agent 至少参与一次、最终收敛
P2 候选融合:从最高分候选升级为多个候选输出融合 fuse_candidate_outputs 和 converge_fused 支持按分数过滤、去重合并多个有效候选 低分噪声被过滤;多个高分候选的有效结论保留;source candidate 可审计
P3 更真实的互相质询:从规则/投票门升级为反驳、修正、再投票 QuestioningConsensusSwarm 增加 challenge、revise、vote 三段式回合 第一轮不允许直接收敛;必须产生质询和修正;第二轮或之后再投票接受

测试标准

本轮仍按 AQS / SW-AQS v1 判断,不按普通软件质量标准判断。核心标准来自:

  • NIST AI RMF / NIST AI 600-1:风险、可控性、可度量性、生成式 AI 失败模式。
  • OWASP LLM Top 10 / OWASP Agentic Skills Top 10:敏感信息、过度代理、工具边界、运行时安全。
  • MITRE ATLAS:失败、诱导、误用和恢复场景。
  • OpenTelemetry:run、task、event、artifact、metric 的可观测证据。
  • LangGraph handoff 参考:active-agent 和上下文交接语义。
  • 本项目 SW-AQS:任务池、共享状态、信息素、handoff、事件、质量门、fallback、共识、扩缩容和收敛。

本轮新增 S09,专门验收三个边界:

  1. sw_aqs_16_scaled_autonomous_claim_3_5_7
  2. candidate_fusion_output
  3. question_revise_revote_consensus

本轮新增 S10,专门验收六个蜂群一级特征:

  1. decentralization_no_single_agent_control_node
  2. self_organization_from_local_interactions
  3. emergence_global_result_exceeds_single_signal
  4. robustness_single_agent_failure_isolated
  5. scalability_three_five_seven_agents_same_architecture
  6. implicit_collaboration_by_environment

本轮新增 L01 / L02,专门把本机规模和模型预算量级纳入验收:

  1. local_large_scale_stress: 使用本机 8 逻辑核、128 Agent、131072 任务验证本地大规模 claim / 执行 / 收敛稳定性。
  2. local_3000_tpm_budget: 使用 8 个 Agent、60 个预算任务、每任务 50 token,验证 3000 TPM 窗口内不超额且利用率打满。

仍不是生产级完整交付的部分

当前补齐的是本地确定性、最小代码级验收。以下仍属于更大范围平台阶段:

  • Manager / Agnet 平台统一接口、人类审批主线、权限、预算和审计全链路。
  • 真实 Kubernetes runtime 的 3/5/7 worker 扩缩容压测。
  • 真实 NewAPI / 模型供应商侧 3000 TPM live 限流、429 重试、费用归因和长期运行曲线。
  • Redis Stream 事件被其他 Agent 实时消费并影响下一步任务图。
  • 自动创建补充 Agnet / 动态任务图,而不是只在当前候选上质询和修正。
  • 收敛速度、Agent 利用率、响应时间、信息素分布等生产监控指标。