AGI 路线调研终稿 · 2026-09-21 快照
APPENDIX · 事实

APPENDIX_facts

40 条承重结论三元组 + 半衰期监控

APPENDIX-facts — 事实核查账本(合并版)

合并自:round3/verify.md(B1–B12 补证核实,2026-09-21)+ round3/freshness.md(半衰期分级 + 监控清单,2026-09-21) 合并日期:2026-09-21。账本内所有"验证日期"均为 2026-09-20/21 实测当日。 用途:MASTER / ROUTE / CHECKLIST / 各 APPENDIX 引用任何带数字结论前,先到本账本查状态;无验证日期或无半衰期的行不允许存在。 副本:本文件同时以 final/APPENDIX-facts.md(连字符版,与 BRIEF §2 命名一致)留档,两份内容相同。


0. 账本 schema 与对账规则

每行统一 schema(6 列):claim | 验证日期 | 置信 | 半衰期 | 重查方法(含下次必查时点与触发器)| URL,末尾附加"对账"列记录 verify↔freshness 对账结果。

  • 置信标签:一手(官方文档/GitHub API/arXiv/HF 实测)|双源(keenable+另一引擎独立一致)|单源(必须标)|低置信(未核实)
  • 半衰期分级(freshness §1 全项目统一口径):H0 ≤2 周(随时翻转)|H1 1–2 个月(价格/版本号)|H2 3–6 个月(活跃度/分数/漏洞披露)|H3 6–24 个月(架构/方法学/论文级)|H∞ 结构性(不重查,只随参数重算)|已定案(不随时间翻转的定论)
  • 状态枚举:现行 / 争议 / 已过时待更新 / 已证伪 / 已关闭 / 未验证 / 监控项

对账(reconciliation)规则(本次合并执行): 1. 价格/政策/模型类结论:verify 与 freshness 双侧覆盖且一致 → 直接采信;数字或口径冲突 → 标 ⚠️ 并在 §3 裁决;仅一侧覆盖 → 标"仅 verify / 仅 freshness"(是分工不是冲突,置信维持原判)。 2. 半衰期两侧赋值冲突时取更短者(严格侧)。 3. 引用已过半衰期的数字 = 降级为"历史快照",不得当"现行状态"表述。 4. H0/H1 级数据禁止写进 ROUTE.md 命令级步骤,除非旁边给出重查命令。


1. 账本 A:verify.md 补证条目 B1–B12(12 条)

# claim 验证日期 置信 半衰期 重查方法 URL 对账
A1 GLM-5.2 SWE-bench Pro = 62.1%(68.5% 系他人数据误传,14 独立源零支持;"开源第一"仅指开源权重第一,整体次于 Claude Opus 4.8 的 69.2) 2026-09-21 一手(官方 model card + z.ai 博客 + 14 源) H1(1–3 个月;verify 原记 6 个月,⚠️冲突裁决见 R1) 下次必查 2026-12-21 或新官方系统卡发布时(T1/T9);只信 Scale 标准化板或官方系统卡 huggingface.co/zai-org/GLM-5.2;z.ai/blog/glm-5.2;morphllm.com/swe-bench-pro 双侧一致(分数);状态=争议→默认采 62.1%
A2 Anthropic Agent SDK 计费分离:已宣布暂停、未生效("For now, nothing has changed"),现行仍是订阅统一计量;重启时间未定,官方承诺提前公告 2026-09-21 双源(官方帮助中心原文 + 两引擎 17 独立源) H0(≤2 周,随时恢复) 每次算个人 token 账单前读 support.claude.com 文章 15036540 顶部 Update 声明;下次必查 2026-10-05 前或政策变动(T2/T8) support.claude.com/en/articles/15036540-use-the-claude-agent-sdk-with-your-claude-plan 双侧一致 ✅(freshness F-02 同判 H0);状态=已暂停待恢复
A3 四仓库星数/创建日/活跃度实测:claude-mem 94,333★(2025-08 建)/ MemPalace 59,176★(2026-04 建,月均 ~10.8k 增速异常)/ openclaw 390,152★ / hermes-agent 247,430★;star 时间戳级增长自然性核查不可行(stargazers 的 starred_at 需认证 token) 2026-09-21 星数/活跃度=一手(GitHub API);增长自然性=低置信 H2(3–6 个月) 季度重跑 curl 直查 api.github.com/repos//(jq 取 stargazers_count / pushed_at / archived 三字段;匿名限流 60 次/时);引用时叙事降格为"星数高企且活跃属实,增长自然性未经审计" api.github.com/repos/{openclaw/openclaw, NousResearch/hermes-agent, thedotmack/claude-mem, MemPalace/mempalace} 双侧一致 ✅(freshness §2.3 同项同法)
A4 Zep Community Edition 官方弃更(FAQ 原文 "deprecated and no longer supported");getzep/zep 仓转 examples/legacy;自托管只剩 Graphiti 引擎 + 自备图数据库(Neo4j/FalkorDB/Neptune/Kuzu);弃更精确日期各源存疑(2025-04 / 2026-03 / mid-2026) 2026-09-21 双源(官方 FAQ 原文 + GitHub 实测 + ≥8 独立源) H2(弃更事件不回翻;托管版价格/功能随 H1 每月厂商公告扫描(T3/T5);自托管选型前复查 Graphiti/Mem0/Letta 现状 help.getzep.com/faq;github.com/getzep/zep 仅 verify(freshness 无对照;有官方 FAQ 一手锚,维持双源采信)
A5 I 域 dashboard.py:未实跑、未经运行验证(生产服务器禁装 promptfoo 依赖;无样例输出数据;promptfoo 输出 JSON 无稳定公开 schema,字段可能随版本漂移) 2026-09-21(静态核查) 低置信(未验证) —(未验证项不适用;promptfoo 0.123.1 版本号本身 H2/3 个月) 在装有 promptfoo 的环境跑通之前,不得列入"可用工具" 无(脚本位于 round1/evaluation.md §7) 仅 verify;状态=未验证
A6 模型分数对官方系统卡抽验:GLM-5.2 62.1 ✅、Opus 4.8 69.2 ✅;Opus 4.8 价格 $5.00/$25.00、1M context 五源一致(自注官方 pricing;Fast Mode $10/$50、Batch 半价、缓存读 $0.50 同);GLM-5.2 价格三说不一($1.40/$4.40 vs $0.95/$3.00 vs $0.75/$2.40)⚠️ 2026-09-21 分数=双源+一手锚;Opus 价格=双源(剔除 SparkAI $0.86/$4.30 离群);GLM-5.2 价格=冲突未裁决 价格 H1(verify 记 1 个月,至 2026-10-21);分数见 R1 GLM-5.2 现价以 z.ai 官方 pricing 页直查为准(待办);聚合站价格只当线索(冲突 9 教训:Luna 输出价聚合站错、官方文档对) huggingface.co/zai-org/GLM-5.2;llm-stats.com/benchmarks/swe-bench-pro;benchlm.ai/models/glm-5-2;pricepertoken.com/pricing-page/model/anthropic-claude-opus-4.8 ⚠️冲突 R2(GLM-5.2 价格);其余双侧一致
A7 Bankrbot 链上攻击(Grok-DRB,2026-05-04)事件链坐实:Morse 指令→Grok 解码回复→Bankrbot 当权威指令转账 3B DRB→抛售;金额 $150K–175K 两说(ikriv ~$150K;SlowMist 转述 ~$175K);METR $600K credits 未核实(10 源零命中) 2026-09-21 事件=双源(4 独立复盘 + SlowMist post-mortem 一致转述);精确金额=单源分歧;METR=低置信(未核实) H3(史实级不翻转;金额待 SlowMist 原帖直读后收敛) SlowMist 官方 post-mortem 命中原文链接时更新金额;METR 条目从 Master 剔除或标"未核实" ikriv.com/blog?p=5462;deeprnd.medium.com/when-bots-trust-bots-the-grok-bankrbot-incident-96338d72e1ff;news.superex.com/articles/34883.html;chainward.ai/decodes/bankr-hack-trace 仅 verify;金额入 Master 必须写区间
A8 2605–2609 批次 10 篇 arXiv 全部实存(abs 页 HTTP 200):GEPA(2507.19457)=ICLR 2026 Oral;MAST(2503.13657) v3、OSWorld 2.0(2606.29537)、SkillsBench(2602.12670)、2607.28576、2607.05904、2409.09510、R-Zero(2508.05004)、Mem0(2504.19413)、LoRA Land(2405.00732) 均预印本无 venue 2026-09-21 一手(官方 abs 页逐条直查) H2(3–6 个月;预印本 3–6 个月内仍有撤稿/大修风险) 季度存活检查,下次必查 2026-12-21:arXiv 页 + Google Scholar 引用情况;撤稿即 T10 全链降级 arxiv.org/abs/{2507.19457, 2503.13657, 2409.09510, 2607.28576, 2607.05904, 2602.12670, 2606.29537, 2508.05004, 2504.19413, 2405.00732} 双侧一致 ✅(freshness §2.3 同项同法)
A9 Hendrycks AGI 分数出处 = arXiv 2510.18212《A Definition of AGI》(Hendrycks 等 33 人,含 Bengio/Tegmark/Gary Marcus):27% 对 GPT-4、57% 对 GPT-5;"jagged profile(锯齿状能力)"与"长时记忆是最大短板"均为论文原文论断 2026-09-21 一手(arXiv PDF 原句命中 + 二级转述交叉) H3(论文级实证,6–24 个月) 半年复核;撤稿/证伪时 T10 arxiv.org/abs/2510.18212 双侧一致 ✅(freshness H3 论文级)
A10 OX Security 事件中 Anthropic 回应原话是 "expected behavior"(预期行为),"by design" 为转述失真;立场:STDIO 是 secure default、消毒是开发者责任(仍属 OX 转述层级,无 Anthropic 官方原文)。量化面(多源一致):4 官方 SDK 同源缺陷 / 11 CVE(2026-04-20 批次)/ 7,000+ 暴露 server / 150M+ 下载 / ~200K 暴露实例 / 6 生产平台实证被攻破 2026-09-21 双源(≥6 独立源一致) H2(6 个月;新 CVE 随时插入) 每月 CVE.org/NVDB 扫描(关键词 MCP/agent/Claude Code)+ T6;引语必须写 "expected behavior" panguard.ai/zh-TW/blog/atr-detects-anthropic-mcp-rce-class;runtimeai.io/blog/2026-06-09-mcp-rce.html;softwareseni.com/how-the-ox-security-audit-exposed-7000-plus-mcp-servers-14-cves-and-one-design-flaw;labs.cloudsecurityalliance.org/research/csa-research-note-mcp-design-rce-protocol-attack-surface-202 双侧一致 ✅(freshness §2.3 安全漏洞面同法)
A11 中文圈一手信息补缺:仍缺,列监控清单 2026-09-21 低置信 —(监控项) 并入事件驱动监控:厂商中文博客/公众号/即时社区,每周扫一次 —(无稳定一手源) 仅 verify;状态=监控项
A12 MAST 失败数据集实存可用:HF mcemri/MAST-Data(补证任务写的 MAD 名称不准确),1,642 条多智能体执行轨迹 / 7 MAS 框架 / 8 benchmark / 5 LLM / 每条 14 失败模式二元标注;CC-BY-4.0;downloads 1,061;full 约 190MB + 19 条人工标注子集 2026-09-21 一手(HF API + README 直读) H3(论文级数据集) 季度 HF API 存活检查(downloads/lastModified) huggingface.co/datasets/mcemri/MAST-Data;github.com/multi-agent-systems-failure-taxonomy/MAST;关联论文 arxiv.org/abs/2503.13657 双侧一致 ✅(freshness H3 列 MAST)

2. 账本 B:freshness.md 半衰期赋值条目(F 组,原 F-01…按序重编)

# claim 验证日期 置信 半衰期 重查方法 URL 对账
F1 国内二手硬件行情:3090 ¥4,200–7,200;魔改 4090 48G ¥25–30K;DDR5 一年涨 3 倍 2026-09-20/21 双源(cost_precision §5.3) H0(华强北一日一价) 采购下单当天:闲鱼/京东列表页快照 + cost_precision §5.3 表逐项比对 闲鱼/京东列表页(快照) 仅 freshness;状态=现行
F2 免费额度快照:硅基流动 14 元 / DeepSeek 500 万 tok / 火山 300 万 tok 2026-09 有效 双源(各官网 pricing 页) 1–3 个月,单家可随时砍(按最短记 H0 阶段 0 开跑当天 + 每月 1 日各官网 pricing 页直查 deepseek.com/pricing;siliconflow.cn/pricing;volcengine.com pricing 页 仅 freshness;状态=现行
F3 智谱/百炼 Coding Plan "限量抢购"(百炼 Pro 每日 9:30 补库存) 2026-09-21 双源 H0(≤1 周) 购买当天 bigmodel.cn / bailian.aliyun.com 实时页 bigmodel.cn;bailian.aliyun.com 仅 freshness;状态=现行
F4 4090 96G 魔改卡传闻:已证伪(Slamtec CTO:384bit×16Gbit=48G 上限) 2026-09-21 一手(当事人原话) 已定案 无需重查,保留为"已证伪"标本 Slamtec CTO 声明(cost_precision) 仅 freshness;状态=已证伪/关闭
F5 国产 API 价格表:DeepSeek Flash ~¥1/M、GLM-5.2 ~¥10/M、Kimi K3 ~¥21.6/M 等(gaps §1.2 / cost §2.2 全表) 2026-09-21 双源(官方 pricing 页口径) H1(1–2 个月) ①账单环比异常 ②厂商公告 ③每月 1 日例行;官方 pricing 页逐家直查,聚合站只当线索(冲突 9 教训:Luna 输出价聚合站错、官方文档对) deepseek.com/pricing;bigmodel.cn/pricing;moonshot 官方页 双侧部分覆盖 ✅(与 A6 价格口径条款合并执行)
F6 模型版本号:Kimi K3 / DeepSeek V4 / Qwen3.8 / GLM-5.2 / GPT-5.6 = 2026-09 现行旗舰 2026-09-21 双源 H1(1–2 个月;METR 翻倍周期 3 个月 ⇒ 代际更替更快) ①任一厂商发新品 ②季度例行:官方博客 / arXiv 技术报告 / GitHub releases(T1) 各厂商官方博客 双侧一致 ✅(verify B6/B8 分数锚同源)
F7 订阅制 Coding Plan 价格与额度:GLM Lite ¥49/120M、Max ¥469/2400M、方舟 Lite ¥40/250M 2026-09-21 双源 3 个月(智谱 2026-02 已整体涨 30% 前科) ①智谱系涨价先例重演 ②季度:官方订阅页(T2) bigmodel.cn 订阅页;阿里云百炼 仅 freshness;状态=现行
F8 DeepSeek 峰谷定价:高峰 01–04/06–10 UTC 翻倍 2026-09-21 双源 H1(1–2 个月) 若扩散到 GLM/Qwen/Kimi → 重算全部闲时策略;官方公告(T2) api-docs.deepseek.com 仅 freshness;状态=现行
F9 benchmark 分数(SWE-bench Pro / OSWorld / AAII) 2026-09-21 见 A1/A6/A8 各项锚 1–3 个月(SWE-bench Verified 已官方弃用前科) ①新模型发布 ②官方弃用公告;只信 Scale 标准化板或官方系统卡,聚合板数字必须带 harness+日期 见账本 A1/A6/A8 双侧一致 ✅
F10 开源 vs 闭源差距:CAISI 口径 8 个月 / 厂商口径 2 个月 2026-09-21 双源 2–3 个月 CAISI 下一期报告(V5 出来即重写):nist.gov CAISI 页(T9) nist.gov CAISI 页 仅 verify 覆盖一分支,freshness 给半衰期
F11 GitHub 项目健康度:ollama 181k★、mem0 65.7k★、browser-use、Dify 等(github_checks.json 2026-09-20) 2026-09-20 一手(GitHub API 实测) H2(3–6 个月) ①推荐进 master doc 前 ②每季度全量重跑脚本;archived=true 或 pushed_at 停滞 >6 个月 = 从推荐清单降级(T5) api.github.com/repos/...(脚本见 §5 月度监控) 双侧一致 ✅(与 A3 同法)
F12 工具版本:Ollama v0.34.2 / promptfoo 0.123.1 / lightrag-hku 1.5.7 / Qdrant 1.19.1(novice_test 实测) 2026-09-21 一手(本机实测) H2(3 个月) ①安装日对 GitHub releases ②每季度:GitHub API releases 页 github.com/{ollama/ollama, promptfoo/promptfoo, HKUDS/LightRAG, qdrant/qdrant} releases 双侧一致 ✅
F13 MCP server 健康度:62% 零维护 + 3 CVE 前科(2026-09 快照) 2026-09-21 双源(红队 1.1-b) H2(3 个月) 每月对白名单 server 跑三条件检查:近 90 天 commit / issue 响应 / vendor 背书 GitHub API + 白名单清单 双侧一致 ✅(与 A10 漏洞面互补)
F14 安全漏洞面:CVE-2025-49596 / 6514 / Claude Code 隐写门 v2.1.91-196 已披露+已修复 2026-09-21 一手(CVE 通报) H2(6 个月,但新 CVE 随时插入 ①新增 MCP/agent 工具时 ②每季度:CVE.org + NVDB + 厂商 release notes(T6) cve.org;NVDB;厂商 release notes 双侧一致 ✅(与 A10 量化面合并引用)
F15 Anthropic 封号数据:2026 H1 = 11.4M 封禁 / 398k 申诉 / 42k 翻案(10.6%) 2026-09-21 双源(官方按半年发布) H2(6 个月) 2027-01 官方 Transparency Hub 更新时重查:anthropic.com/transparency anthropic.com/transparency 仅 freshness;状态=现行
F16 监管框架:7-15 拟人化新规、AI 标识办法、开源托管责任(2026-09 生效中) 2026-09-21 双源 H2(6 个月;综合 AI 法最早 2027;7-15 新规前科 ⇒ 偏乐观,用 T4 对冲) ①CAC 新规公告 ②执法案例出现:网信办官网 + Concordia AI 季度追踪(T4) cac.gov.cn;Concordia AI 季报 仅 freshness;状态=现行
F17 免费层存续不可依赖(Gemini CLI 已断供前科) 2026-09-21 双源 H2(3 个月) 任何厂商"限额调整"公告:官方公告 + 社区实测帖(T3) 各厂商公告 仅 freshness;状态=现行
F18 记忆分层结论:<100K 直塞 / 跨会话必用记忆层 2026-09-21 双源(Round 1 A 域论文级) H3(12–24 个月) 失效条件:出现"会话间持久上下文"原生机制且被复现 round1/personal_memory.md 引文 双侧一致 ✅(方向级)
F19 微调三分法:SFT 格式固化真 / 个人化 PEFT 近零 +1.07% / 自训练塌缩 2026-09-21 双源(LaMP / LoRA Land / 塌缩文献,论文级) H3(12–24 个月) 失效条件:出现可复现的"个人数据注入知识"同行评审实证(LoRA Land 原文 arXiv 2405.00732 已 A8 实存) round1/continual_learning.md;arxiv.org/abs/2405.00732 双侧一致 ✅
F20 盈亏平衡结构:个人用量 << 平衡点 ⇒ API/订阅赢 2026-09-21 双源(cost §4.2 口径) H3(12 个月;前提:国产 API 不出现 10 倍级涨价) 失效触发:①硬件价格崩(内存 2027H2 缓解)②API 大涨 ③个人 agent 用量模式质变;半年重算(T2) round3/cost_route.md §4.2 双侧一致 ✅
F21 多智能体"读并行写单线程"共识 2026-09-21 双源(MAST 论文级) H3(6–12 个月) 失效条件:长程共享上下文成本结构性下降的实证 arxiv.org/abs/2503.13657 双侧一致 ✅
F22 安全架构原则:防御在模型外、HITL、fail-closed 2026-09-21 双源(原则级) H∞(原则级不重查) 失效条件:模型层可靠解决 prompt injection 的官方声明 + 复现 round2/security_redteam.md 双侧一致 ✅
F23 "个人做不到"清单:不训基座 / 不全自主 24/7 / 不权重自提升 2026-09-21 双源 H3(12 个月) 半年复核:每条找到仍然成立的最新证据才保留;对应反方证据被推翻即删 round2/redteam_optimism.md 双侧一致 ✅
F24 统计功效数学:30 题单题粒度 3.3pp > ±2pp ⇒ 阈值必须 ≥2 题 2026-09-21 一手(数学推导) H∞ 不重查;题目数改变时重算 round2/audit_methodology 双侧一致 ✅
F25 长任务乘法墙:单步 90% × 15 步 = 20.6% 2026-09-21 一手(数学推导) H∞ 不重查;单步可靠率改变时重算 round1/agent_orchestration 双侧一致 ✅
F26 订阅 vs 按量杠杆结构:token 单价差 1–2 个数量级 2026-09-21 双源 H∞ 不重查;单价改变时重算(与 F20 联动) round3/cost_route.md 双侧一致 ✅
F27 C 域承重论文评审状态(2605–2609 批次多为预印本) 2026-09-21 一手 H2(3–6 个月) 季度存活检查:arXiv 页 + Google Scholar 引用情况(与 A8 同一动作,勿重复执行) 见 A8 双侧一致 ✅(=A8 的半衰期面)
F28 评测方法论:私有回归套件 + 锚点陷阱 + 阈值 ≥2 题(阈值随题目数重算) 2026-09-21 一手(数学推导 + I 域方法级) H∞(方法级) 不重查;题目数改变时重算阈值 round2/audit_methodology;round1/evaluation.md 双侧一致 ✅

3. 对账裁决(reconciliation 结果)

总对账 40 条:双侧一致 24 条(含 A1/A6/F5/F10 部分覆盖);仅一侧覆盖 14 条(分工不冲突,维持原置信);实质冲突 2 处(R1 半衰期取短、R2 价格未裁决),裁决如下。

R1 ⚠️ 半衰期冲突:GLM-5.2 SWE-bench Pro 分数(A1)

  • verify.md §1 记"半衰期 6 个月,至 2027-03 前重查"(H2 档);freshness §2.2 对 benchmark 分数统一记 1–3 个月H1 档,理由:SWE-bench Verified 已有官方弃用前科 + 新旗舰发布即取代)。
  • 裁决:按对账规则取更短者 = H1(1–3 个月),下次必查 2026-12-21(季度例行)或 T1 新官方系统卡发布时,以先到者为准。 分数本身无冲突(两侧均默认 62.1%),仅过期策略收紧。

R2 ⚠️ 价格冲突:GLM-5.2 现价三说不一(A6 × F5)

  • keenable 多源 $1.40/$4.40 | morphllm $0.95/$3.00(称降价)| llm-stats $0.75/$2.40(每百万 tokens,输入/输出)。
  • 裁决:全部标"冲突未裁决",GLM-5.2 现价必须以 z.ai 官方 pricing 页直查为准(列入待办,H1,至 2026-10-21 前完成);聚合站价格一律只当线索(冲突 9 教训:Luna 输出价聚合站错、官方文档对)。在裁决完成前,任何交付物引用 GLM-5.2 价格必须写"¥/$ 口径三说不一,未定案"。
  • 对照组:Opus 4.8 $5.00/$25.00 五源一致且自注官方 pricing,可采(剔除 SparkAI $0.86/$4.30 离群值,疑转售/镜像价)。

其余对账说明:A4(Zep)、A5(dashboard.py)、A7(Bankrbot/METR)、A11(中文一手)为 verify 单侧覆盖——freshness 属方法/监控文件,不逐条对应,不算冲突;F1–F4、F7–F8、F15–F17 同理为 freshness 单侧覆盖。A3/A8/A12 与 F11/F12/F27 是同一事实的两个侧面(事实面 + 半衰期面),已互相标注、动作不重复执行。


4. 触发器总表(事件驱动,freshness §3 原样保留;到期重查之外的即时触发)

# 触发器 影响范围 动作
T1 任一厂商发布新旗舰模型 D 域全部分数与价格、master doc 8 维表 新模型分数只认官方系统卡;旧分数标注"已被取代"
T2 任一官方 pricing 页变动(涨或降 >20%) cost_precision 全部账单、四档预算 重跑账单表;检查"订阅 vs 按量"结论是否翻转
T3 任一免费层/公测结束公告(智谱 2026-08 前科) 阶段 0 免费池、教学装 免费池替换方案 24 小时内更新
T4 CAC / 任何监管机构新规生效 五大场景红线、security 附录 重走合规清单;红线变化写入 final CHANGELOG
T5 所用工具 major 版本更新或归档(Continue 归档误判教训) ROUTE.md 命令 GitHub API 确认 archived + pushed_at;命令重测后更新
T6 新一轮 CVE 涉及 agent/MCP 工具链 security 附录 评估是否影响白名单;必要时升级/替换
T7 自家评测套件连续 2 期跌破基线 全部"系统在进步"结论 先查模型静默升级(T1 交叉),再查任务集过拟合——顺序不可颠倒
T8 代充/支付渠道风控事件(阿里禁用 Claude Code 先例) J 域购买渠道表 渠道风险等级重评
T9 CAISI / METR 发布新一期官方数据 中美差距、翻倍周期、时间地平线 用新官方口径替换,废弃第三方转述
T10 被引论文被撤稿/证伪 对应域结论 全链路降级并在本账本标"已证伪"

5. 监控清单(可执行,freshness §4 原样保留并绑定本账本)

5.1 月度(每月 1 日,约 30 分钟;最简版只做 ③④,约 5 分钟)

# ① 价格抽查(3 家代表厂商官方页人工过一遍)
#    deepseek.com/pricing  bigmodel.cn/pricing  siliconflow.cn/pricing
# ② 免费额度抽查:同一批官网页的"免费/新用户"区块
# ③ 核心工具版本漂移:
for r in ollama/ollama promptfoo/promptfoo HKUDS/LightRAG qdrant/qdrant mem0ai/mem0 browser-use/browser-use; do
  curl -s https://api.github.com/repos/$r | jq -r '"\(.full_name) \(.stargazers_count)★ pushed=\(.pushed_at) archived=\(.archived)"'
done
# ④ 自查:final/ 里所有标 H0/H1 且验证日期 >45 天的条目 → 触发重查
#   (按本账本"验证日期"列 + 半衰期列筛)

月度输出追加到 final/CHANGELOG.md,一行一条:日期 | 变了什么 | 影响哪份文件 | 已更新✅/无变化

5.2 季度(每季首月,约 2 小时)

  1. GitHub 健康度全量:github_checks.json 里 44 个仓库全部重跑,与旧值比对(archived=true 或 pushed_at 停滞 >6 个月 = 降级)。
  2. MCP server 白名单三条件:近 90 天 commit / issue 响应 / vendor 背书,不达标者移出并找替代。
  3. benchmark 分数对手系统卡:master doc 引用的每个模型分数核对官方系统卡;聚合板数字全部加日期重验。
  4. judge 校准:30 例一致率 ≥85%,跌破则改 judge prompt(I 域规则)。
  5. 监管快照:CAC 官网 + Concordia AI 季报过一遍,新增法规补进安全附录。
  6. 厂商切换演练:假设主力 API 消失,计时恢复 3 个核心任务(目标 <30 分钟);记录实测耗时替换"2 小时"修辞。

5.3 半年(重点:H3 级结论存活性 = F18–F23 逐条)

  • 重读反方报告(counterarguments + redteam_optimism)逐条问:这条反对论据今天还成立吗?
  • 论文存活检查:C 域承重预印本是否已过同行评审 / 被证伪(= A8,下次 2026-12-21 起季度执行)。
  • 盈亏平衡重算:最新价格 + 当前实际用量重算平衡点表(cost §4.2 代码口径,= F20)。
  • "个人做不到"清单复核:每条找到仍然成立的最新证据才保留(= F23)。

5.4 事件驱动订阅源

信息源 监控什么 频率
各厂商官方博客/公告(DeepSeek/智谱/Moonshot/OpenAI/Anthropic) 新模型、价格、政策、弃用 每周
support.claude.com 政策文章顶部 Update 声明(= A2 条目 15036540) 计费/封号政策翻转(X4 教训) 每周
CAC 官网 + GB 标准公告 新规、执法通报 每月
metr.org + nist.gov/CAISI 官方评估数据更新 每月
CVE.org / NVDB(关键词:MCP, agent, Claude Code, browser-use) 新漏洞 每月
OpenAI/Anthropic model deprecation 页 模型退役通知(前科:2 周通知期) 每月
中文圈一手渠道(厂商中文博客/公众号/社区) A11 缺口补源 每周

6. 降权项 X 对账收口(verify 各节结论带入)

X 项 状态 依据条目
X3(GLM-5.2 分数) 结案:统一 62.1%,删除一切 68.5% 引用 A1
X4(Agent SDK 计费分离) 结案:由"监控中"升级为"已核实暂停";成本结论按现行订阅统一计量改写 A2
X8(Zep CE 弃更) 结案:单源升级为一手+多源;自托管推荐链 = Mem0 / Letta / Graphiti(自备图库) A4
X10(Hendrycks 27/57) 前半结案:补正式引用 arXiv 2510.18212;"微软协议 AGI 出现 8 次→0 次"仍未核实,维持降权 A9
X11(聚合分低置信) 部分收口:默认规则维持;已有一手锚的数字(GLM-5.2 62.1 / Opus 4.8 69.2 / Opus 4.8 $5/$25)标注"已对官方卡核实"后可用;Fable 5 / Mythos / GPT-5.6 / Qwen3.8 Max / Kimi K3 等其余新代号分数仍低置信,逐一对系统卡后方可入 Master A6
X13(OX Security) 部分结案:引语改 "expected behavior";40+ CVE / 24,008 泄露密钥 / 492 裸奔 server 三项仍无一手,维持降权 A10
X14(Bankrbot 金额) 部分结案:入 Master 必须写区间 $150K–175K 并标"SlowMist 原帖未直读";METR $600K 剔除或标"未核实" A7
X5(2025 H2 封号数据) 维持:已被 2026 H1 数据取代(F15 为现行口径) F15
X1/X2/X6/X7/X9/X12/X15/X16 本轮未触及,维持 Round 2 原判

7. 账本统计与自我锐评

  • 账本规模:A 组 12 条(verify B1–B12)+ F 组 28 条(freshness 赋值表 + H∞ 数学条)= 40 条;无一条缺验证日期或缺半衰期(未验证项 A5 标"低置信/未验证"、已定案项 F4 标"已定案",符合状态枚举)。来源缺口披露:verify.md 原文缺 §11(B11 详述节,编号从 §10 跳至 §12),B11 仅据其汇总表一行带入账本 A11——引用时按"低置信/监控项"对待。
  • 对账结果:双侧一致 24 / 单侧覆盖 14 / 实质冲突 2(R1 取更短半衰期、R2 价格待官方页裁决)。
  • 锐评(freshness §6 带入):① 半衰期赋值是判断不是测量,监管类 H2=6 个月在 7-15 新规前科面前偏乐观(T4 对冲);② 月度 30 分钟监控对"傻瓜用户"仍偏重,最可行降级 = 只做 5.1 ③④(约 5 分钟),价格靠账单异常被动发现;③ 未覆盖港台/海外读者(时效结构完全不同),需按 gaps §9.9 单独分叉。
  • 最危险的三条(引用前必查):A2(H0 政策随时恢复)> F1(H0 硬件一日一价)> A6-R2(GLM-5.2 价格未裁决)。

合并完成于 2026-09-21。本账本半衰期:方法级(schema/触发器/监控流程)H2=6 个月复核;账本内具体数字随各自半衰期独立过期。