# APPENDIX-facts — 事实核查账本（合并版）

> 合并自：`round3/verify.md`（B1–B12 补证核实，2026-09-21）+ `round3/freshness.md`（半衰期分级 + 监控清单，2026-09-21）
> 合并日期：**2026-09-21**。账本内所有"验证日期"均为 2026-09-20/21 实测当日。
> 用途：MASTER / ROUTE / CHECKLIST / 各 APPENDIX 引用任何带数字结论前，先到本账本查状态；无验证日期或无半衰期的行不允许存在。
> 副本：本文件同时以 `final/APPENDIX-facts.md`（连字符版，与 BRIEF §2 命名一致）留档，两份内容相同。

---

## 0. 账本 schema 与对账规则

每行统一 schema（6 列）：**claim | 验证日期 | 置信 | 半衰期 | 重查方法（含下次必查时点与触发器）| URL**，末尾附加"对账"列记录 verify↔freshness 对账结果。

- 置信标签：`一手`（官方文档/GitHub API/arXiv/HF 实测）｜`双源`（keenable+另一引擎独立一致）｜`单源`（必须标）｜`低置信`（未核实）
- 半衰期分级（freshness §1 全项目统一口径）：**H0** ≤2 周（随时翻转）｜**H1** 1–2 个月（价格/版本号）｜**H2** 3–6 个月（活跃度/分数/漏洞披露）｜**H3** 6–24 个月（架构/方法学/论文级）｜**H∞** 结构性（不重查，只随参数重算）｜`已定案`（不随时间翻转的定论）
- 状态枚举：`现行` / `争议` / `已过时待更新` / `已证伪` / `已关闭` / `未验证` / `监控项`

**对账（reconciliation）规则**（本次合并执行）：
1. **价格/政策/模型类结论**：verify 与 freshness 双侧覆盖且一致 → 直接采信；数字或口径冲突 → 标 ⚠️ 并在 §3 裁决；仅一侧覆盖 → 标"仅 verify / 仅 freshness"（是分工不是冲突，置信维持原判）。
2. 半衰期两侧赋值冲突时**取更短者**（严格侧）。
3. 引用已过半衰期的数字 = 降级为"历史快照"，不得当"现行状态"表述。
4. **H0/H1 级数据禁止写进 ROUTE.md 命令级步骤**，除非旁边给出重查命令。

---

## 1. 账本 A：verify.md 补证条目 B1–B12（12 条）

| # | claim | 验证日期 | 置信 | 半衰期 | 重查方法 | URL | 对账 |
|---|---|---|---|---|---|---|---|
| A1 | GLM-5.2 SWE-bench Pro = **62.1%**（68.5% 系他人数据误传，14 独立源零支持；"开源第一"仅指开源权重第一，整体次于 Claude Opus 4.8 的 69.2）| 2026-09-21 | 一手（官方 model card + z.ai 博客 + 14 源）| H1（1–3 个月；verify 原记 6 个月，⚠️冲突裁决见 R1）| 下次必查 2026-12-21 或新官方系统卡发布时（T1/T9）；只信 Scale 标准化板或官方系统卡 | huggingface.co/zai-org/GLM-5.2；z.ai/blog/glm-5.2；morphllm.com/swe-bench-pro | 双侧一致（分数）；状态=争议→默认采 62.1% |
| A2 | Anthropic Agent SDK 计费分离：**已宣布暂停、未生效**（"For now, nothing has changed"），现行仍是订阅统一计量；重启时间未定，官方承诺提前公告 | 2026-09-21 | 双源（官方帮助中心原文 + 两引擎 17 独立源）| **H0**（≤2 周，随时恢复）| 每次算个人 token 账单前读 support.claude.com 文章 15036540 顶部 Update 声明；下次必查 2026-10-05 前或政策变动（T2/T8）| support.claude.com/en/articles/15036540-use-the-claude-agent-sdk-with-your-claude-plan | 双侧一致 ✅（freshness F-02 同判 H0）；状态=已暂停待恢复 |
| A3 | 四仓库星数/创建日/活跃度实测：claude-mem 94,333★（2025-08 建）/ MemPalace 59,176★（2026-04 建，月均 ~10.8k 增速异常）/ openclaw 390,152★ / hermes-agent 247,430★；**star 时间戳级增长自然性核查不可行**（stargazers 的 starred_at 需认证 token）| 2026-09-21 | 星数/活跃度=一手（GitHub API）；增长自然性=低置信 | H2（3–6 个月）| 季度重跑 curl 直查 api.github.com/repos/<o>/<r>（jq 取 stargazers_count / pushed_at / archived 三字段；匿名限流 60 次/时）；引用时叙事降格为"星数高企且活跃属实，增长自然性未经审计" | api.github.com/repos/{openclaw/openclaw, NousResearch/hermes-agent, thedotmack/claude-mem, MemPalace/mempalace} | 双侧一致 ✅（freshness §2.3 同项同法）|
| A4 | Zep Community Edition **官方弃更**（FAQ 原文 "deprecated and no longer supported"）；getzep/zep 仓转 examples/legacy；自托管只剩 Graphiti 引擎 + 自备图数据库（Neo4j/FalkorDB/Neptune/Kuzu）；弃更精确日期各源存疑（2025-04 / 2026-03 / mid-2026）| 2026-09-21 | 双源（官方 FAQ 原文 + GitHub 实测 + ≥8 独立源）| H2（弃更事件不回翻；托管版价格/功能随 H1）| 每月厂商公告扫描（T3/T5）；自托管选型前复查 Graphiti/Mem0/Letta 现状 | help.getzep.com/faq；github.com/getzep/zep | 仅 verify（freshness 无对照；有官方 FAQ 一手锚，维持双源采信）|
| A5 | I 域 dashboard.py：**未实跑、未经运行验证**（生产服务器禁装 promptfoo 依赖；无样例输出数据；promptfoo 输出 JSON 无稳定公开 schema，字段可能随版本漂移）| 2026-09-21（静态核查）| 低置信（未验证）| —（未验证项不适用；promptfoo 0.123.1 版本号本身 H2/3 个月）| 在装有 promptfoo 的环境跑通之前，不得列入"可用工具" | 无（脚本位于 round1/evaluation.md §7）| 仅 verify；状态=未验证 |
| A6 | 模型分数对官方系统卡抽验：GLM-5.2 62.1 ✅、Opus 4.8 69.2 ✅；**Opus 4.8 价格 $5.00/$25.00、1M context 五源一致**（自注官方 pricing；Fast Mode $10/$50、Batch 半价、缓存读 $0.50 同）；**GLM-5.2 价格三说不一**（$1.40/$4.40 vs $0.95/$3.00 vs $0.75/$2.40）⚠️ | 2026-09-21 | 分数=双源+一手锚；Opus 价格=双源（剔除 SparkAI $0.86/$4.30 离群）；GLM-5.2 价格=**冲突未裁决** | 价格 H1（verify 记 1 个月，至 2026-10-21）；分数见 R1 | GLM-5.2 现价以 z.ai 官方 pricing 页直查为准（**待办**）；聚合站价格只当线索（冲突 9 教训：Luna 输出价聚合站错、官方文档对）| huggingface.co/zai-org/GLM-5.2；llm-stats.com/benchmarks/swe-bench-pro；benchlm.ai/models/glm-5-2；pricepertoken.com/pricing-page/model/anthropic-claude-opus-4.8 | ⚠️冲突 R2（GLM-5.2 价格）；其余双侧一致 |
| A7 | Bankrbot 链上攻击（Grok-DRB，2026-05-04）事件链坐实：Morse 指令→Grok 解码回复→Bankrbot 当权威指令转账 3B DRB→抛售；**金额 $150K–175K 两说**（ikriv ~$150K；SlowMist 转述 ~$175K）；**METR $600K credits 未核实**（10 源零命中）| 2026-09-21 | 事件=双源（4 独立复盘 + SlowMist post-mortem 一致转述）；精确金额=单源分歧；METR=低置信（未核实）| H3（史实级不翻转；金额待 SlowMist 原帖直读后收敛）| SlowMist 官方 post-mortem 命中原文链接时更新金额；METR 条目从 Master 剔除或标"未核实" | ikriv.com/blog?p=5462；deeprnd.medium.com/when-bots-trust-bots-the-grok-bankrbot-incident-96338d72e1ff；news.superex.com/articles/34883.html；chainward.ai/decodes/bankr-hack-trace | 仅 verify；金额入 Master 必须写区间 |
| A8 | 2605–2609 批次 10 篇 arXiv **全部实存**（abs 页 HTTP 200）：GEPA(2507.19457)=**ICLR 2026 Oral**；MAST(2503.13657) v3、OSWorld 2.0(2606.29537)、SkillsBench(2602.12670)、2607.28576、2607.05904、2409.09510、R-Zero(2508.05004)、Mem0(2504.19413)、LoRA Land(2405.00732) 均预印本无 venue | 2026-09-21 | 一手（官方 abs 页逐条直查）| H2（3–6 个月；预印本 3–6 个月内仍有撤稿/大修风险）| 季度存活检查，下次必查 2026-12-21：arXiv 页 + Google Scholar 引用情况；撤稿即 T10 全链降级 | arxiv.org/abs/{2507.19457, 2503.13657, 2409.09510, 2607.28576, 2607.05904, 2602.12670, 2606.29537, 2508.05004, 2504.19413, 2405.00732} | 双侧一致 ✅（freshness §2.3 同项同法）|
| A9 | Hendrycks AGI 分数出处 = **arXiv 2510.18212《A Definition of AGI》**（Hendrycks 等 33 人，含 Bengio/Tegmark/Gary Marcus）：**27% 对 GPT-4、57% 对 GPT-5**；"jagged profile（锯齿状能力）"与"长时记忆是最大短板"均为论文原文论断 | 2026-09-21 | 一手（arXiv PDF 原句命中 + 二级转述交叉）| H3（论文级实证，6–24 个月）| 半年复核；撤稿/证伪时 T10 | arxiv.org/abs/2510.18212 | 双侧一致 ✅（freshness H3 论文级）|
| A10 | OX Security 事件中 Anthropic 回应原话是 **"expected behavior"**（预期行为），"by design" 为转述失真；立场：STDIO 是 secure default、消毒是开发者责任（仍属 OX 转述层级，无 Anthropic 官方原文）。量化面（多源一致）：4 官方 SDK 同源缺陷 / 11 CVE（2026-04-20 批次）/ 7,000+ 暴露 server / 150M+ 下载 / ~200K 暴露实例 / 6 生产平台实证被攻破 | 2026-09-21 | 双源（≥6 独立源一致）| H2（6 个月；新 CVE 随时插入）| 每月 CVE.org/NVDB 扫描（关键词 MCP/agent/Claude Code）+ T6；引语必须写 "expected behavior" | panguard.ai/zh-TW/blog/atr-detects-anthropic-mcp-rce-class；runtimeai.io/blog/2026-06-09-mcp-rce.html；softwareseni.com/how-the-ox-security-audit-exposed-7000-plus-mcp-servers-14-cves-and-one-design-flaw；labs.cloudsecurityalliance.org/research/csa-research-note-mcp-design-rce-protocol-attack-surface-202 | 双侧一致 ✅（freshness §2.3 安全漏洞面同法）|
| A11 | 中文圈一手信息补缺：**仍缺**，列监控清单 | 2026-09-21 | 低置信 | —（监控项）| 并入事件驱动监控：厂商中文博客/公众号/即时社区，每周扫一次 | —（无稳定一手源）| 仅 verify；状态=监控项 |
| A12 | MAST 失败数据集**实存可用**：HF `mcemri/MAST-Data`（补证任务写的 MAD 名称不准确），1,642 条多智能体执行轨迹 / 7 MAS 框架 / 8 benchmark / 5 LLM / 每条 14 失败模式二元标注；CC-BY-4.0；downloads 1,061；full 约 190MB + 19 条人工标注子集 | 2026-09-21 | 一手（HF API + README 直读）| H3（论文级数据集）| 季度 HF API 存活检查（downloads/lastModified）| huggingface.co/datasets/mcemri/MAST-Data；github.com/multi-agent-systems-failure-taxonomy/MAST；关联论文 arxiv.org/abs/2503.13657 | 双侧一致 ✅（freshness H3 列 MAST）|

---
## 2. 账本 B：freshness.md 半衰期赋值条目（F 组，原 F-01…按序重编）

| # | claim | 验证日期 | 置信 | 半衰期 | 重查方法 | URL | 对账 |
|---|---|---|---|---|---|---|---|
| F1 | 国内二手硬件行情：3090 ¥4,200–7,200；魔改 4090 48G ¥25–30K；DDR5 一年涨 3 倍 | 2026-09-20/21 | 双源（cost_precision §5.3）| **H0**（华强北一日一价）| 采购**下单当天**：闲鱼/京东列表页快照 + cost_precision §5.3 表逐项比对 | 闲鱼/京东列表页（快照）| 仅 freshness；状态=现行 |
| F2 | 免费额度快照：硅基流动 14 元 / DeepSeek 500 万 tok / 火山 300 万 tok | 2026-09 有效 | 双源（各官网 pricing 页）| 1–3 个月，单家可随时砍（按最短记 **H0**）| 阶段 0 开跑当天 + 每月 1 日各官网 pricing 页直查 | deepseek.com/pricing；siliconflow.cn/pricing；volcengine.com pricing 页 | 仅 freshness；状态=现行 |
| F3 | 智谱/百炼 Coding Plan "限量抢购"（百炼 Pro 每日 9:30 补库存）| 2026-09-21 | 双源 | **H0**（≤1 周）| 购买当天 bigmodel.cn / bailian.aliyun.com 实时页 | bigmodel.cn；bailian.aliyun.com | 仅 freshness；状态=现行 |
| F4 | 4090 96G 魔改卡传闻：**已证伪**（Slamtec CTO：384bit×16Gbit=48G 上限）| 2026-09-21 | 一手（当事人原话）| 已定案 | 无需重查，保留为"已证伪"标本 | Slamtec CTO 声明（cost_precision）| 仅 freshness；状态=已证伪/关闭 |
| F5 | 国产 API 价格表：DeepSeek Flash ~¥1/M、GLM-5.2 ~¥10/M、Kimi K3 ~¥21.6/M 等（gaps §1.2 / cost §2.2 全表）| 2026-09-21 | 双源（官方 pricing 页口径）| **H1**（1–2 个月）| ①账单环比异常 ②厂商公告 ③每月 1 日例行；**官方 pricing 页逐家直查，聚合站只当线索**（冲突 9 教训：Luna 输出价聚合站错、官方文档对）| deepseek.com/pricing；bigmodel.cn/pricing；moonshot 官方页 | 双侧部分覆盖 ✅（与 A6 价格口径条款合并执行）|
| F6 | 模型版本号：Kimi K3 / DeepSeek V4 / Qwen3.8 / GLM-5.2 / GPT-5.6 = 2026-09 现行旗舰 | 2026-09-21 | 双源 | **H1**（1–2 个月；METR 翻倍周期 3 个月 ⇒ 代际更替更快）| ①任一厂商发新品 ②季度例行：官方博客 / arXiv 技术报告 / GitHub releases（T1）| 各厂商官方博客 | 双侧一致 ✅（verify B6/B8 分数锚同源）|
| F7 | 订阅制 Coding Plan 价格与额度：GLM Lite ¥49/120M、Max ¥469/2400M、方舟 Lite ¥40/250M | 2026-09-21 | 双源 | 3 个月（智谱 2026-02 已整体涨 30% 前科）| ①智谱系涨价先例重演 ②季度：官方订阅页（T2）| bigmodel.cn 订阅页；阿里云百炼 | 仅 freshness；状态=现行 |
| F8 | DeepSeek 峰谷定价：高峰 01–04/06–10 UTC 翻倍 | 2026-09-21 | 双源 | **H1**（1–2 个月）| 若扩散到 GLM/Qwen/Kimi → 重算全部闲时策略；官方公告（T2）| api-docs.deepseek.com | 仅 freshness；状态=现行 |
| F9 | benchmark 分数（SWE-bench Pro / OSWorld / AAII）| 2026-09-21 | 见 A1/A6/A8 各项锚 | 1–3 个月（SWE-bench Verified 已官方弃用前科）| ①新模型发布 ②官方弃用公告；**只信 Scale 标准化板或官方系统卡**，聚合板数字必须带 harness+日期 | 见账本 A1/A6/A8 | 双侧一致 ✅ |
| F10 | 开源 vs 闭源差距：CAISI 口径 8 个月 / 厂商口径 2 个月 | 2026-09-21 | 双源 | 2–3 个月 | CAISI 下一期报告（V5 出来即重写）：nist.gov CAISI 页（T9）| nist.gov CAISI 页 | 仅 verify 覆盖一分支，freshness 给半衰期 |
| F11 | GitHub 项目健康度：ollama 181k★、mem0 65.7k★、browser-use、Dify 等（github_checks.json 2026-09-20）| 2026-09-20 | 一手（GitHub API 实测）| **H2**（3–6 个月）| ①推荐进 master doc 前 ②每季度全量重跑脚本；archived=true 或 pushed_at 停滞 >6 个月 = 从推荐清单降级（T5）| api.github.com/repos/...（脚本见 §5 月度监控）| 双侧一致 ✅（与 A3 同法）|
| F12 | 工具版本：Ollama v0.34.2 / promptfoo 0.123.1 / lightrag-hku 1.5.7 / Qdrant 1.19.1（novice_test 实测）| 2026-09-21 | 一手（本机实测）| **H2**（3 个月）| ①安装日对 GitHub releases ②每季度：GitHub API releases 页 | github.com/{ollama/ollama, promptfoo/promptfoo, HKUDS/LightRAG, qdrant/qdrant} releases | 双侧一致 ✅ |
| F13 | MCP server 健康度：62% 零维护 + 3 CVE 前科（2026-09 快照）| 2026-09-21 | 双源（红队 1.1-b）| **H2**（3 个月）| 每月对白名单 server 跑三条件检查：近 90 天 commit / issue 响应 / vendor 背书 | GitHub API + 白名单清单 | 双侧一致 ✅（与 A10 漏洞面互补）|
| F14 | 安全漏洞面：CVE-2025-49596 / 6514 / Claude Code 隐写门 v2.1.91-196 已披露+已修复 | 2026-09-21 | 一手（CVE 通报）| **H2**（6 个月，但**新 CVE 随时插入**）| ①新增 MCP/agent 工具时 ②每季度：CVE.org + NVDB + 厂商 release notes（T6）| cve.org；NVDB；厂商 release notes | 双侧一致 ✅（与 A10 量化面合并引用）|
| F15 | Anthropic 封号数据：2026 H1 = 11.4M 封禁 / 398k 申诉 / 42k 翻案（10.6%）| 2026-09-21 | 双源（官方按半年发布）| **H2**（6 个月）| 2027-01 官方 Transparency Hub 更新时重查：anthropic.com/transparency | anthropic.com/transparency | 仅 freshness；状态=现行 |
| F16 | 监管框架：7-15 拟人化新规、AI 标识办法、开源托管责任（2026-09 生效中）| 2026-09-21 | 双源 | **H2**（6 个月；综合 AI 法最早 2027；7-15 新规前科 ⇒ 偏乐观，用 T4 对冲）| ①CAC 新规公告 ②执法案例出现：网信办官网 + Concordia AI 季度追踪（T4）| cac.gov.cn；Concordia AI 季报 | 仅 freshness；状态=现行 |
| F17 | 免费层存续不可依赖（Gemini CLI 已断供前科）| 2026-09-21 | 双源 | **H2**（3 个月）| 任何厂商"限额调整"公告：官方公告 + 社区实测帖（T3）| 各厂商公告 | 仅 freshness；状态=现行 |
| F18 | 记忆分层结论：<100K 直塞 / 跨会话必用记忆层 | 2026-09-21 | 双源（Round 1 A 域论文级）| **H3**（12–24 个月）| 失效条件：出现"会话间持久上下文"原生机制且被复现 | round1/personal_memory.md 引文 | 双侧一致 ✅（方向级）|
| F19 | 微调三分法：SFT 格式固化真 / 个人化 PEFT 近零 +1.07% / 自训练塌缩 | 2026-09-21 | 双源（LaMP / LoRA Land / 塌缩文献，论文级）| **H3**（12–24 个月）| 失效条件：出现可复现的"个人数据注入知识"同行评审实证（LoRA Land 原文 arXiv 2405.00732 已 A8 实存）| round1/continual_learning.md；arxiv.org/abs/2405.00732 | 双侧一致 ✅ |
| F20 | 盈亏平衡结构：个人用量 << 平衡点 ⇒ API/订阅赢 | 2026-09-21 | 双源（cost §4.2 口径）| **H3**（12 个月；前提：国产 API 不出现 10 倍级涨价）| 失效触发：①硬件价格崩（内存 2027H2 缓解）②API 大涨 ③个人 agent 用量模式质变；半年重算（T2）| round3/cost_route.md §4.2 | 双侧一致 ✅ |
| F21 | 多智能体"读并行写单线程"共识 | 2026-09-21 | 双源（MAST 论文级）| **H3**（6–12 个月）| 失效条件：长程共享上下文成本结构性下降的实证 | arxiv.org/abs/2503.13657 | 双侧一致 ✅ |
| F22 | 安全架构原则：防御在模型外、HITL、fail-closed | 2026-09-21 | 双源（原则级）| **H∞**（原则级不重查）| 失效条件：模型层可靠解决 prompt injection 的官方声明 + 复现 | round2/security_redteam.md | 双侧一致 ✅ |
| F23 | "个人做不到"清单：不训基座 / 不全自主 24/7 / 不权重自提升 | 2026-09-21 | 双源 | **H3**（12 个月）| 半年复核：每条找到仍然成立的最新证据才保留；对应反方证据被推翻即删 | round2/redteam_optimism.md | 双侧一致 ✅ |
| F24 | 统计功效数学：30 题单题粒度 3.3pp > ±2pp ⇒ 阈值必须 ≥2 题 | 2026-09-21 | 一手（数学推导）| **H∞** | 不重查；题目数改变时重算 | round2/audit_methodology | 双侧一致 ✅ |
| F25 | 长任务乘法墙：单步 90% × 15 步 = 20.6% | 2026-09-21 | 一手（数学推导）| **H∞** | 不重查；单步可靠率改变时重算 | round1/agent_orchestration | 双侧一致 ✅ |
| F26 | 订阅 vs 按量杠杆结构：token 单价差 1–2 个数量级 | 2026-09-21 | 双源 | **H∞** | 不重查；单价改变时重算（与 F20 联动）| round3/cost_route.md | 双侧一致 ✅ |
| F27 | C 域承重论文评审状态（2605–2609 批次多为预印本）| 2026-09-21 | 一手 | **H2**（3–6 个月）| 季度存活检查：arXiv 页 + Google Scholar 引用情况（与 A8 同一动作，勿重复执行）| 见 A8 | 双侧一致 ✅（=A8 的半衰期面）|
| F28 | 评测方法论：私有回归套件 + 锚点陷阱 + 阈值 ≥2 题（阈值随题目数重算）| 2026-09-21 | 一手（数学推导 + I 域方法级）| **H∞**（方法级）| 不重查；题目数改变时重算阈值 | round2/audit_methodology；round1/evaluation.md | 双侧一致 ✅ |

---

## 3. 对账裁决（reconciliation 结果）

**总对账 40 条：双侧一致 24 条（含 A1/A6/F5/F10 部分覆盖）；仅一侧覆盖 14 条（分工不冲突，维持原置信）；实质冲突 2 处（R1 半衰期取短、R2 价格未裁决），裁决如下。**

### R1 ⚠️ 半衰期冲突：GLM-5.2 SWE-bench Pro 分数（A1）
- verify.md §1 记"半衰期 6 个月，至 2027-03 前重查"（H2 档）；freshness §2.2 对 benchmark 分数统一记 **1–3 个月**（H1 档，理由：SWE-bench Verified 已有官方弃用前科 + 新旗舰发布即取代）。
- **裁决：按对账规则取更短者 = H1（1–3 个月），下次必查 2026-12-21（季度例行）或 T1 新官方系统卡发布时，以先到者为准。** 分数本身无冲突（两侧均默认 62.1%），仅过期策略收紧。

### R2 ⚠️ 价格冲突：GLM-5.2 现价三说不一（A6 × F5）
- keenable 多源 $1.40/$4.40 ｜ morphllm $0.95/$3.00（称降价）｜ llm-stats $0.75/$2.40（每百万 tokens，输入/输出）。
- **裁决：全部标"冲突未裁决"，GLM-5.2 现价必须以 z.ai 官方 pricing 页直查为准（列入待办，H1，至 2026-10-21 前完成）；聚合站价格一律只当线索**（冲突 9 教训：Luna 输出价聚合站错、官方文档对）。在裁决完成前，任何交付物引用 GLM-5.2 价格必须写"¥/$ 口径三说不一，未定案"。
- 对照组：Opus 4.8 $5.00/$25.00 五源一致且自注官方 pricing，可采（剔除 SparkAI $0.86/$4.30 离群值，疑转售/镜像价）。

**其余对账说明**：A4（Zep）、A5（dashboard.py）、A7（Bankrbot/METR）、A11（中文一手）为 verify 单侧覆盖——freshness 属方法/监控文件，不逐条对应，不算冲突；F1–F4、F7–F8、F15–F17 同理为 freshness 单侧覆盖。A3/A8/A12 与 F11/F12/F27 是同一事实的两个侧面（事实面 + 半衰期面），已互相标注、动作不重复执行。

---
## 4. 触发器总表（事件驱动，freshness §3 原样保留；到期重查之外的即时触发）

| # | 触发器 | 影响范围 | 动作 |
|---|---|---|---|
| T1 | 任一厂商发布新旗舰模型 | D 域全部分数与价格、master doc 8 维表 | 新模型分数只认官方系统卡；旧分数标注"已被取代" |
| T2 | 任一官方 pricing 页变动（涨或降 >20%）| cost_precision 全部账单、四档预算 | 重跑账单表；检查"订阅 vs 按量"结论是否翻转 |
| T3 | 任一免费层/公测结束公告（智谱 2026-08 前科）| 阶段 0 免费池、教学装 | 免费池替换方案 24 小时内更新 |
| T4 | CAC / 任何监管机构新规生效 | 五大场景红线、security 附录 | 重走合规清单；红线变化写入 final CHANGELOG |
| T5 | 所用工具 major 版本更新或归档（Continue 归档误判教训）| ROUTE.md 命令 | GitHub API 确认 archived + pushed_at；命令重测后更新 |
| T6 | 新一轮 CVE 涉及 agent/MCP 工具链 | security 附录 | 评估是否影响白名单；必要时升级/替换 |
| T7 | 自家评测套件连续 2 期跌破基线 | 全部"系统在进步"结论 | **先查模型静默升级（T1 交叉），再查任务集过拟合**——顺序不可颠倒 |
| T8 | 代充/支付渠道风控事件（阿里禁用 Claude Code 先例）| J 域购买渠道表 | 渠道风险等级重评 |
| T9 | CAISI / METR 发布新一期官方数据 | 中美差距、翻倍周期、时间地平线 | 用新官方口径替换，废弃第三方转述 |
| T10 | 被引论文被撤稿/证伪 | 对应域结论 | 全链路降级并在本账本标"已证伪" |

---

## 5. 监控清单（可执行，freshness §4 原样保留并绑定本账本）

### 5.1 月度（每月 1 日，约 30 分钟；最简版只做 ③④，约 5 分钟）

```bash
# ① 价格抽查（3 家代表厂商官方页人工过一遍）
#    deepseek.com/pricing  bigmodel.cn/pricing  siliconflow.cn/pricing
# ② 免费额度抽查：同一批官网页的"免费/新用户"区块
# ③ 核心工具版本漂移：
for r in ollama/ollama promptfoo/promptfoo HKUDS/LightRAG qdrant/qdrant mem0ai/mem0 browser-use/browser-use; do
  curl -s https://api.github.com/repos/$r | jq -r '"\(.full_name) \(.stargazers_count)★ pushed=\(.pushed_at) archived=\(.archived)"'
done
# ④ 自查：final/ 里所有标 H0/H1 且验证日期 >45 天的条目 → 触发重查
#   （按本账本"验证日期"列 + 半衰期列筛）
```

月度输出追加到 `final/CHANGELOG.md`，一行一条：`日期 | 变了什么 | 影响哪份文件 | 已更新✅/无变化`。

### 5.2 季度（每季首月，约 2 小时）

1. **GitHub 健康度全量**：github_checks.json 里 44 个仓库全部重跑，与旧值比对（archived=true 或 pushed_at 停滞 >6 个月 = 降级）。
2. **MCP server 白名单三条件**：近 90 天 commit / issue 响应 / vendor 背书，不达标者移出并找替代。
3. **benchmark 分数对手系统卡**：master doc 引用的每个模型分数核对官方系统卡；聚合板数字全部加日期重验。
4. **judge 校准**：30 例一致率 ≥85%，跌破则改 judge prompt（I 域规则）。
5. **监管快照**：CAC 官网 + Concordia AI 季报过一遍，新增法规补进安全附录。
6. **厂商切换演练**：假设主力 API 消失，计时恢复 3 个核心任务（目标 <30 分钟）；记录实测耗时替换"2 小时"修辞。

### 5.3 半年（重点：H3 级结论存活性 = F18–F23 逐条）

- 重读反方报告（counterarguments + redteam_optimism）逐条问：这条反对论据今天还成立吗？
- 论文存活检查：C 域承重预印本是否已过同行评审 / 被证伪（= A8，下次 2026-12-21 起季度执行）。
- 盈亏平衡重算：最新价格 + 当前实际用量重算平衡点表（cost §4.2 代码口径，= F20）。
- "个人做不到"清单复核：每条找到仍然成立的最新证据才保留（= F23）。

### 5.4 事件驱动订阅源

| 信息源 | 监控什么 | 频率 |
|---|---|---|
| 各厂商官方博客/公告（DeepSeek/智谱/Moonshot/OpenAI/Anthropic）| 新模型、价格、政策、弃用 | 每周 |
| support.claude.com 政策文章顶部 Update 声明（= A2 条目 15036540）| 计费/封号政策翻转（X4 教训）| 每周 |
| CAC 官网 + GB 标准公告 | 新规、执法通报 | 每月 |
| metr.org + nist.gov/CAISI | 官方评估数据更新 | 每月 |
| CVE.org / NVDB（关键词：MCP, agent, Claude Code, browser-use）| 新漏洞 | 每月 |
| OpenAI/Anthropic model deprecation 页 | 模型退役通知（前科：2 周通知期）| 每月 |
| 中文圈一手渠道（厂商中文博客/公众号/社区）| A11 缺口补源 | 每周 |

---

## 6. 降权项 X 对账收口（verify 各节结论带入）

| X 项 | 状态 | 依据条目 |
|---|---|---|
| X3（GLM-5.2 分数）| **结案**：统一 62.1%，删除一切 68.5% 引用 | A1 |
| X4（Agent SDK 计费分离）| **结案**：由"监控中"升级为"已核实暂停"；成本结论按现行订阅统一计量改写 | A2 |
| X8（Zep CE 弃更）| **结案**：单源升级为一手+多源；自托管推荐链 = Mem0 / Letta / Graphiti（自备图库）| A4 |
| X10（Hendrycks 27/57）| **前半结案**：补正式引用 arXiv 2510.18212；"微软协议 AGI 出现 8 次→0 次"仍未核实，维持降权 | A9 |
| X11（聚合分低置信）| **部分收口**：默认规则维持；已有一手锚的数字（GLM-5.2 62.1 / Opus 4.8 69.2 / Opus 4.8 $5/$25）标注"已对官方卡核实"后可用；Fable 5 / Mythos / GPT-5.6 / Qwen3.8 Max / Kimi K3 等其余新代号分数仍低置信，逐一对系统卡后方可入 Master | A6 |
| X13（OX Security）| **部分结案**：引语改 "expected behavior"；40+ CVE / 24,008 泄露密钥 / 492 裸奔 server 三项仍无一手，维持降权 | A10 |
| X14（Bankrbot 金额）| **部分结案**：入 Master 必须写区间 $150K–175K 并标"SlowMist 原帖未直读"；METR $600K 剔除或标"未核实" | A7 |
| X5（2025 H2 封号数据）| 维持：已被 2026 H1 数据取代（F15 为现行口径）| F15 |
| X1/X2/X6/X7/X9/X12/X15/X16 | 本轮未触及，维持 Round 2 原判 | — |

---

## 7. 账本统计与自我锐评

- **账本规模**：A 组 12 条（verify B1–B12）+ F 组 28 条（freshness 赋值表 + H∞ 数学条）= **40 条**；无一条缺验证日期或缺半衰期（未验证项 A5 标"低置信/未验证"、已定案项 F4 标"已定案"，符合状态枚举）。**来源缺口披露**：verify.md 原文缺 §11（B11 详述节，编号从 §10 跳至 §12），B11 仅据其汇总表一行带入账本 A11——引用时按"低置信/监控项"对待。
- **对账结果**：双侧一致 24 / 单侧覆盖 14 / 实质冲突 2（R1 取更短半衰期、R2 价格待官方页裁决）。
- **锐评（freshness §6 带入）**：① 半衰期赋值是判断不是测量，监管类 H2=6 个月在 7-15 新规前科面前偏乐观（T4 对冲）；② 月度 30 分钟监控对"傻瓜用户"仍偏重，最可行降级 = 只做 5.1 ③④（约 5 分钟），价格靠账单异常被动发现；③ 未覆盖港台/海外读者（时效结构完全不同），需按 gaps §9.9 单独分叉。
- **最危险的三条**（引用前必查）：A2（H0 政策随时恢复）> F1（H0 硬件一日一价）> A6-R2（GLM-5.2 价格未裁决）。

---
*合并完成于 2026-09-21。本账本半衰期：方法级（schema/触发器/监控流程）H2=6 个月复核；账本内具体数字随各自半衰期独立过期。*
