APPENDIX-facts — 事实核查账本(合并版)¶
合并自:
round3/verify.md(B1–B12 补证核实,2026-09-21)+round3/freshness.md(半衰期分级 + 监控清单,2026-09-21) 合并日期:2026-09-21。账本内所有"验证日期"均为 2026-09-20/21 实测当日。 用途:MASTER / ROUTE / CHECKLIST / 各 APPENDIX 引用任何带数字结论前,先到本账本查状态;无验证日期或无半衰期的行不允许存在。 副本:本文件同时以final/APPENDIX-facts.md(连字符版,与 BRIEF §2 命名一致)留档,两份内容相同。
0. 账本 schema 与对账规则¶
每行统一 schema(6 列):claim | 验证日期 | 置信 | 半衰期 | 重查方法(含下次必查时点与触发器)| URL,末尾附加"对账"列记录 verify↔freshness 对账结果。
- 置信标签:
一手(官方文档/GitHub API/arXiv/HF 实测)|双源(keenable+另一引擎独立一致)|单源(必须标)|低置信(未核实) - 半衰期分级(freshness §1 全项目统一口径):H0 ≤2 周(随时翻转)|H1 1–2 个月(价格/版本号)|H2 3–6 个月(活跃度/分数/漏洞披露)|H3 6–24 个月(架构/方法学/论文级)|H∞ 结构性(不重查,只随参数重算)|
已定案(不随时间翻转的定论) - 状态枚举:
现行/争议/已过时待更新/已证伪/已关闭/未验证/监控项
对账(reconciliation)规则(本次合并执行): 1. 价格/政策/模型类结论:verify 与 freshness 双侧覆盖且一致 → 直接采信;数字或口径冲突 → 标 ⚠️ 并在 §3 裁决;仅一侧覆盖 → 标"仅 verify / 仅 freshness"(是分工不是冲突,置信维持原判)。 2. 半衰期两侧赋值冲突时取更短者(严格侧)。 3. 引用已过半衰期的数字 = 降级为"历史快照",不得当"现行状态"表述。 4. H0/H1 级数据禁止写进 ROUTE.md 命令级步骤,除非旁边给出重查命令。
1. 账本 A:verify.md 补证条目 B1–B12(12 条)¶
| # | claim | 验证日期 | 置信 | 半衰期 | 重查方法 | URL | 对账 |
|---|---|---|---|---|---|---|---|
| A1 | GLM-5.2 SWE-bench Pro = 62.1%(68.5% 系他人数据误传,14 独立源零支持;"开源第一"仅指开源权重第一,整体次于 Claude Opus 4.8 的 69.2) | 2026-09-21 | 一手(官方 model card + z.ai 博客 + 14 源) | H1(1–3 个月;verify 原记 6 个月,⚠️冲突裁决见 R1) | 下次必查 2026-12-21 或新官方系统卡发布时(T1/T9);只信 Scale 标准化板或官方系统卡 | huggingface.co/zai-org/GLM-5.2;z.ai/blog/glm-5.2;morphllm.com/swe-bench-pro | 双侧一致(分数);状态=争议→默认采 62.1% |
| A2 | Anthropic Agent SDK 计费分离:已宣布暂停、未生效("For now, nothing has changed"),现行仍是订阅统一计量;重启时间未定,官方承诺提前公告 | 2026-09-21 | 双源(官方帮助中心原文 + 两引擎 17 独立源) | H0(≤2 周,随时恢复) | 每次算个人 token 账单前读 support.claude.com 文章 15036540 顶部 Update 声明;下次必查 2026-10-05 前或政策变动(T2/T8) | support.claude.com/en/articles/15036540-use-the-claude-agent-sdk-with-your-claude-plan | 双侧一致 ✅(freshness F-02 同判 H0);状态=已暂停待恢复 |
| A3 | 四仓库星数/创建日/活跃度实测:claude-mem 94,333★(2025-08 建)/ MemPalace 59,176★(2026-04 建,月均 ~10.8k 增速异常)/ openclaw 390,152★ / hermes-agent 247,430★;star 时间戳级增长自然性核查不可行(stargazers 的 starred_at 需认证 token) | 2026-09-21 | 星数/活跃度=一手(GitHub API);增长自然性=低置信 | H2(3–6 个月) | 季度重跑 curl 直查 api.github.com/repos/ |
api.github.com/repos/{openclaw/openclaw, NousResearch/hermes-agent, thedotmack/claude-mem, MemPalace/mempalace} | 双侧一致 ✅(freshness §2.3 同项同法) |
| A4 | Zep Community Edition 官方弃更(FAQ 原文 "deprecated and no longer supported");getzep/zep 仓转 examples/legacy;自托管只剩 Graphiti 引擎 + 自备图数据库(Neo4j/FalkorDB/Neptune/Kuzu);弃更精确日期各源存疑(2025-04 / 2026-03 / mid-2026) | 2026-09-21 | 双源(官方 FAQ 原文 + GitHub 实测 + ≥8 独立源) | H2(弃更事件不回翻;托管版价格/功能随 H1) | 每月厂商公告扫描(T3/T5);自托管选型前复查 Graphiti/Mem0/Letta 现状 | help.getzep.com/faq;github.com/getzep/zep | 仅 verify(freshness 无对照;有官方 FAQ 一手锚,维持双源采信) |
| A5 | I 域 dashboard.py:未实跑、未经运行验证(生产服务器禁装 promptfoo 依赖;无样例输出数据;promptfoo 输出 JSON 无稳定公开 schema,字段可能随版本漂移) | 2026-09-21(静态核查) | 低置信(未验证) | —(未验证项不适用;promptfoo 0.123.1 版本号本身 H2/3 个月) | 在装有 promptfoo 的环境跑通之前,不得列入"可用工具" | 无(脚本位于 round1/evaluation.md §7) | 仅 verify;状态=未验证 |
| A6 | 模型分数对官方系统卡抽验:GLM-5.2 62.1 ✅、Opus 4.8 69.2 ✅;Opus 4.8 价格 $5.00/$25.00、1M context 五源一致(自注官方 pricing;Fast Mode $10/$50、Batch 半价、缓存读 $0.50 同);GLM-5.2 价格三说不一($1.40/$4.40 vs $0.95/$3.00 vs $0.75/$2.40)⚠️ | 2026-09-21 | 分数=双源+一手锚;Opus 价格=双源(剔除 SparkAI $0.86/$4.30 离群);GLM-5.2 价格=冲突未裁决 | 价格 H1(verify 记 1 个月,至 2026-10-21);分数见 R1 | GLM-5.2 现价以 z.ai 官方 pricing 页直查为准(待办);聚合站价格只当线索(冲突 9 教训:Luna 输出价聚合站错、官方文档对) | huggingface.co/zai-org/GLM-5.2;llm-stats.com/benchmarks/swe-bench-pro;benchlm.ai/models/glm-5-2;pricepertoken.com/pricing-page/model/anthropic-claude-opus-4.8 | ⚠️冲突 R2(GLM-5.2 价格);其余双侧一致 |
| A7 | Bankrbot 链上攻击(Grok-DRB,2026-05-04)事件链坐实:Morse 指令→Grok 解码回复→Bankrbot 当权威指令转账 3B DRB→抛售;金额 $150K–175K 两说(ikriv ~$150K;SlowMist 转述 ~$175K);METR $600K credits 未核实(10 源零命中) | 2026-09-21 | 事件=双源(4 独立复盘 + SlowMist post-mortem 一致转述);精确金额=单源分歧;METR=低置信(未核实) | H3(史实级不翻转;金额待 SlowMist 原帖直读后收敛) | SlowMist 官方 post-mortem 命中原文链接时更新金额;METR 条目从 Master 剔除或标"未核实" | ikriv.com/blog?p=5462;deeprnd.medium.com/when-bots-trust-bots-the-grok-bankrbot-incident-96338d72e1ff;news.superex.com/articles/34883.html;chainward.ai/decodes/bankr-hack-trace | 仅 verify;金额入 Master 必须写区间 |
| A8 | 2605–2609 批次 10 篇 arXiv 全部实存(abs 页 HTTP 200):GEPA(2507.19457)=ICLR 2026 Oral;MAST(2503.13657) v3、OSWorld 2.0(2606.29537)、SkillsBench(2602.12670)、2607.28576、2607.05904、2409.09510、R-Zero(2508.05004)、Mem0(2504.19413)、LoRA Land(2405.00732) 均预印本无 venue | 2026-09-21 | 一手(官方 abs 页逐条直查) | H2(3–6 个月;预印本 3–6 个月内仍有撤稿/大修风险) | 季度存活检查,下次必查 2026-12-21:arXiv 页 + Google Scholar 引用情况;撤稿即 T10 全链降级 | arxiv.org/abs/{2507.19457, 2503.13657, 2409.09510, 2607.28576, 2607.05904, 2602.12670, 2606.29537, 2508.05004, 2504.19413, 2405.00732} | 双侧一致 ✅(freshness §2.3 同项同法) |
| A9 | Hendrycks AGI 分数出处 = arXiv 2510.18212《A Definition of AGI》(Hendrycks 等 33 人,含 Bengio/Tegmark/Gary Marcus):27% 对 GPT-4、57% 对 GPT-5;"jagged profile(锯齿状能力)"与"长时记忆是最大短板"均为论文原文论断 | 2026-09-21 | 一手(arXiv PDF 原句命中 + 二级转述交叉) | H3(论文级实证,6–24 个月) | 半年复核;撤稿/证伪时 T10 | arxiv.org/abs/2510.18212 | 双侧一致 ✅(freshness H3 论文级) |
| A10 | OX Security 事件中 Anthropic 回应原话是 "expected behavior"(预期行为),"by design" 为转述失真;立场:STDIO 是 secure default、消毒是开发者责任(仍属 OX 转述层级,无 Anthropic 官方原文)。量化面(多源一致):4 官方 SDK 同源缺陷 / 11 CVE(2026-04-20 批次)/ 7,000+ 暴露 server / 150M+ 下载 / ~200K 暴露实例 / 6 生产平台实证被攻破 | 2026-09-21 | 双源(≥6 独立源一致) | H2(6 个月;新 CVE 随时插入) | 每月 CVE.org/NVDB 扫描(关键词 MCP/agent/Claude Code)+ T6;引语必须写 "expected behavior" | panguard.ai/zh-TW/blog/atr-detects-anthropic-mcp-rce-class;runtimeai.io/blog/2026-06-09-mcp-rce.html;softwareseni.com/how-the-ox-security-audit-exposed-7000-plus-mcp-servers-14-cves-and-one-design-flaw;labs.cloudsecurityalliance.org/research/csa-research-note-mcp-design-rce-protocol-attack-surface-202 | 双侧一致 ✅(freshness §2.3 安全漏洞面同法) |
| A11 | 中文圈一手信息补缺:仍缺,列监控清单 | 2026-09-21 | 低置信 | —(监控项) | 并入事件驱动监控:厂商中文博客/公众号/即时社区,每周扫一次 | —(无稳定一手源) | 仅 verify;状态=监控项 |
| A12 | MAST 失败数据集实存可用:HF mcemri/MAST-Data(补证任务写的 MAD 名称不准确),1,642 条多智能体执行轨迹 / 7 MAS 框架 / 8 benchmark / 5 LLM / 每条 14 失败模式二元标注;CC-BY-4.0;downloads 1,061;full 约 190MB + 19 条人工标注子集 |
2026-09-21 | 一手(HF API + README 直读) | H3(论文级数据集) | 季度 HF API 存活检查(downloads/lastModified) | huggingface.co/datasets/mcemri/MAST-Data;github.com/multi-agent-systems-failure-taxonomy/MAST;关联论文 arxiv.org/abs/2503.13657 | 双侧一致 ✅(freshness H3 列 MAST) |
2. 账本 B:freshness.md 半衰期赋值条目(F 组,原 F-01…按序重编)¶
| # | claim | 验证日期 | 置信 | 半衰期 | 重查方法 | URL | 对账 |
|---|---|---|---|---|---|---|---|
| F1 | 国内二手硬件行情:3090 ¥4,200–7,200;魔改 4090 48G ¥25–30K;DDR5 一年涨 3 倍 | 2026-09-20/21 | 双源(cost_precision §5.3) | H0(华强北一日一价) | 采购下单当天:闲鱼/京东列表页快照 + cost_precision §5.3 表逐项比对 | 闲鱼/京东列表页(快照) | 仅 freshness;状态=现行 |
| F2 | 免费额度快照:硅基流动 14 元 / DeepSeek 500 万 tok / 火山 300 万 tok | 2026-09 有效 | 双源(各官网 pricing 页) | 1–3 个月,单家可随时砍(按最短记 H0) | 阶段 0 开跑当天 + 每月 1 日各官网 pricing 页直查 | deepseek.com/pricing;siliconflow.cn/pricing;volcengine.com pricing 页 | 仅 freshness;状态=现行 |
| F3 | 智谱/百炼 Coding Plan "限量抢购"(百炼 Pro 每日 9:30 补库存) | 2026-09-21 | 双源 | H0(≤1 周) | 购买当天 bigmodel.cn / bailian.aliyun.com 实时页 | bigmodel.cn;bailian.aliyun.com | 仅 freshness;状态=现行 |
| F4 | 4090 96G 魔改卡传闻:已证伪(Slamtec CTO:384bit×16Gbit=48G 上限) | 2026-09-21 | 一手(当事人原话) | 已定案 | 无需重查,保留为"已证伪"标本 | Slamtec CTO 声明(cost_precision) | 仅 freshness;状态=已证伪/关闭 |
| F5 | 国产 API 价格表:DeepSeek Flash ~¥1/M、GLM-5.2 ~¥10/M、Kimi K3 ~¥21.6/M 等(gaps §1.2 / cost §2.2 全表) | 2026-09-21 | 双源(官方 pricing 页口径) | H1(1–2 个月) | ①账单环比异常 ②厂商公告 ③每月 1 日例行;官方 pricing 页逐家直查,聚合站只当线索(冲突 9 教训:Luna 输出价聚合站错、官方文档对) | deepseek.com/pricing;bigmodel.cn/pricing;moonshot 官方页 | 双侧部分覆盖 ✅(与 A6 价格口径条款合并执行) |
| F6 | 模型版本号:Kimi K3 / DeepSeek V4 / Qwen3.8 / GLM-5.2 / GPT-5.6 = 2026-09 现行旗舰 | 2026-09-21 | 双源 | H1(1–2 个月;METR 翻倍周期 3 个月 ⇒ 代际更替更快) | ①任一厂商发新品 ②季度例行:官方博客 / arXiv 技术报告 / GitHub releases(T1) | 各厂商官方博客 | 双侧一致 ✅(verify B6/B8 分数锚同源) |
| F7 | 订阅制 Coding Plan 价格与额度:GLM Lite ¥49/120M、Max ¥469/2400M、方舟 Lite ¥40/250M | 2026-09-21 | 双源 | 3 个月(智谱 2026-02 已整体涨 30% 前科) | ①智谱系涨价先例重演 ②季度:官方订阅页(T2) | bigmodel.cn 订阅页;阿里云百炼 | 仅 freshness;状态=现行 |
| F8 | DeepSeek 峰谷定价:高峰 01–04/06–10 UTC 翻倍 | 2026-09-21 | 双源 | H1(1–2 个月) | 若扩散到 GLM/Qwen/Kimi → 重算全部闲时策略;官方公告(T2) | api-docs.deepseek.com | 仅 freshness;状态=现行 |
| F9 | benchmark 分数(SWE-bench Pro / OSWorld / AAII) | 2026-09-21 | 见 A1/A6/A8 各项锚 | 1–3 个月(SWE-bench Verified 已官方弃用前科) | ①新模型发布 ②官方弃用公告;只信 Scale 标准化板或官方系统卡,聚合板数字必须带 harness+日期 | 见账本 A1/A6/A8 | 双侧一致 ✅ |
| F10 | 开源 vs 闭源差距:CAISI 口径 8 个月 / 厂商口径 2 个月 | 2026-09-21 | 双源 | 2–3 个月 | CAISI 下一期报告(V5 出来即重写):nist.gov CAISI 页(T9) | nist.gov CAISI 页 | 仅 verify 覆盖一分支,freshness 给半衰期 |
| F11 | GitHub 项目健康度:ollama 181k★、mem0 65.7k★、browser-use、Dify 等(github_checks.json 2026-09-20) | 2026-09-20 | 一手(GitHub API 实测) | H2(3–6 个月) | ①推荐进 master doc 前 ②每季度全量重跑脚本;archived=true 或 pushed_at 停滞 >6 个月 = 从推荐清单降级(T5) | api.github.com/repos/...(脚本见 §5 月度监控) | 双侧一致 ✅(与 A3 同法) |
| F12 | 工具版本:Ollama v0.34.2 / promptfoo 0.123.1 / lightrag-hku 1.5.7 / Qdrant 1.19.1(novice_test 实测) | 2026-09-21 | 一手(本机实测) | H2(3 个月) | ①安装日对 GitHub releases ②每季度:GitHub API releases 页 | github.com/{ollama/ollama, promptfoo/promptfoo, HKUDS/LightRAG, qdrant/qdrant} releases | 双侧一致 ✅ |
| F13 | MCP server 健康度:62% 零维护 + 3 CVE 前科(2026-09 快照) | 2026-09-21 | 双源(红队 1.1-b) | H2(3 个月) | 每月对白名单 server 跑三条件检查:近 90 天 commit / issue 响应 / vendor 背书 | GitHub API + 白名单清单 | 双侧一致 ✅(与 A10 漏洞面互补) |
| F14 | 安全漏洞面:CVE-2025-49596 / 6514 / Claude Code 隐写门 v2.1.91-196 已披露+已修复 | 2026-09-21 | 一手(CVE 通报) | H2(6 个月,但新 CVE 随时插入) | ①新增 MCP/agent 工具时 ②每季度:CVE.org + NVDB + 厂商 release notes(T6) | cve.org;NVDB;厂商 release notes | 双侧一致 ✅(与 A10 量化面合并引用) |
| F15 | Anthropic 封号数据:2026 H1 = 11.4M 封禁 / 398k 申诉 / 42k 翻案(10.6%) | 2026-09-21 | 双源(官方按半年发布) | H2(6 个月) | 2027-01 官方 Transparency Hub 更新时重查:anthropic.com/transparency | anthropic.com/transparency | 仅 freshness;状态=现行 |
| F16 | 监管框架:7-15 拟人化新规、AI 标识办法、开源托管责任(2026-09 生效中) | 2026-09-21 | 双源 | H2(6 个月;综合 AI 法最早 2027;7-15 新规前科 ⇒ 偏乐观,用 T4 对冲) | ①CAC 新规公告 ②执法案例出现:网信办官网 + Concordia AI 季度追踪(T4) | cac.gov.cn;Concordia AI 季报 | 仅 freshness;状态=现行 |
| F17 | 免费层存续不可依赖(Gemini CLI 已断供前科) | 2026-09-21 | 双源 | H2(3 个月) | 任何厂商"限额调整"公告:官方公告 + 社区实测帖(T3) | 各厂商公告 | 仅 freshness;状态=现行 |
| F18 | 记忆分层结论:<100K 直塞 / 跨会话必用记忆层 | 2026-09-21 | 双源(Round 1 A 域论文级) | H3(12–24 个月) | 失效条件:出现"会话间持久上下文"原生机制且被复现 | round1/personal_memory.md 引文 | 双侧一致 ✅(方向级) |
| F19 | 微调三分法:SFT 格式固化真 / 个人化 PEFT 近零 +1.07% / 自训练塌缩 | 2026-09-21 | 双源(LaMP / LoRA Land / 塌缩文献,论文级) | H3(12–24 个月) | 失效条件:出现可复现的"个人数据注入知识"同行评审实证(LoRA Land 原文 arXiv 2405.00732 已 A8 实存) | round1/continual_learning.md;arxiv.org/abs/2405.00732 | 双侧一致 ✅ |
| F20 | 盈亏平衡结构:个人用量 << 平衡点 ⇒ API/订阅赢 | 2026-09-21 | 双源(cost §4.2 口径) | H3(12 个月;前提:国产 API 不出现 10 倍级涨价) | 失效触发:①硬件价格崩(内存 2027H2 缓解)②API 大涨 ③个人 agent 用量模式质变;半年重算(T2) | round3/cost_route.md §4.2 | 双侧一致 ✅ |
| F21 | 多智能体"读并行写单线程"共识 | 2026-09-21 | 双源(MAST 论文级) | H3(6–12 个月) | 失效条件:长程共享上下文成本结构性下降的实证 | arxiv.org/abs/2503.13657 | 双侧一致 ✅ |
| F22 | 安全架构原则:防御在模型外、HITL、fail-closed | 2026-09-21 | 双源(原则级) | H∞(原则级不重查) | 失效条件:模型层可靠解决 prompt injection 的官方声明 + 复现 | round2/security_redteam.md | 双侧一致 ✅ |
| F23 | "个人做不到"清单:不训基座 / 不全自主 24/7 / 不权重自提升 | 2026-09-21 | 双源 | H3(12 个月) | 半年复核:每条找到仍然成立的最新证据才保留;对应反方证据被推翻即删 | round2/redteam_optimism.md | 双侧一致 ✅ |
| F24 | 统计功效数学:30 题单题粒度 3.3pp > ±2pp ⇒ 阈值必须 ≥2 题 | 2026-09-21 | 一手(数学推导) | H∞ | 不重查;题目数改变时重算 | round2/audit_methodology | 双侧一致 ✅ |
| F25 | 长任务乘法墙:单步 90% × 15 步 = 20.6% | 2026-09-21 | 一手(数学推导) | H∞ | 不重查;单步可靠率改变时重算 | round1/agent_orchestration | 双侧一致 ✅ |
| F26 | 订阅 vs 按量杠杆结构:token 单价差 1–2 个数量级 | 2026-09-21 | 双源 | H∞ | 不重查;单价改变时重算(与 F20 联动) | round3/cost_route.md | 双侧一致 ✅ |
| F27 | C 域承重论文评审状态(2605–2609 批次多为预印本) | 2026-09-21 | 一手 | H2(3–6 个月) | 季度存活检查:arXiv 页 + Google Scholar 引用情况(与 A8 同一动作,勿重复执行) | 见 A8 | 双侧一致 ✅(=A8 的半衰期面) |
| F28 | 评测方法论:私有回归套件 + 锚点陷阱 + 阈值 ≥2 题(阈值随题目数重算) | 2026-09-21 | 一手(数学推导 + I 域方法级) | H∞(方法级) | 不重查;题目数改变时重算阈值 | round2/audit_methodology;round1/evaluation.md | 双侧一致 ✅ |
3. 对账裁决(reconciliation 结果)¶
总对账 40 条:双侧一致 24 条(含 A1/A6/F5/F10 部分覆盖);仅一侧覆盖 14 条(分工不冲突,维持原置信);实质冲突 2 处(R1 半衰期取短、R2 价格未裁决),裁决如下。
R1 ⚠️ 半衰期冲突:GLM-5.2 SWE-bench Pro 分数(A1)¶
- verify.md §1 记"半衰期 6 个月,至 2027-03 前重查"(H2 档);freshness §2.2 对 benchmark 分数统一记 1–3 个月(H1 档,理由:SWE-bench Verified 已有官方弃用前科 + 新旗舰发布即取代)。
- 裁决:按对账规则取更短者 = H1(1–3 个月),下次必查 2026-12-21(季度例行)或 T1 新官方系统卡发布时,以先到者为准。 分数本身无冲突(两侧均默认 62.1%),仅过期策略收紧。
R2 ⚠️ 价格冲突:GLM-5.2 现价三说不一(A6 × F5)¶
- keenable 多源 $1.40/$4.40 | morphllm $0.95/$3.00(称降价)| llm-stats $0.75/$2.40(每百万 tokens,输入/输出)。
- 裁决:全部标"冲突未裁决",GLM-5.2 现价必须以 z.ai 官方 pricing 页直查为准(列入待办,H1,至 2026-10-21 前完成);聚合站价格一律只当线索(冲突 9 教训:Luna 输出价聚合站错、官方文档对)。在裁决完成前,任何交付物引用 GLM-5.2 价格必须写"¥/$ 口径三说不一,未定案"。
- 对照组:Opus 4.8 $5.00/$25.00 五源一致且自注官方 pricing,可采(剔除 SparkAI $0.86/$4.30 离群值,疑转售/镜像价)。
其余对账说明:A4(Zep)、A5(dashboard.py)、A7(Bankrbot/METR)、A11(中文一手)为 verify 单侧覆盖——freshness 属方法/监控文件,不逐条对应,不算冲突;F1–F4、F7–F8、F15–F17 同理为 freshness 单侧覆盖。A3/A8/A12 与 F11/F12/F27 是同一事实的两个侧面(事实面 + 半衰期面),已互相标注、动作不重复执行。
4. 触发器总表(事件驱动,freshness §3 原样保留;到期重查之外的即时触发)¶
| # | 触发器 | 影响范围 | 动作 |
|---|---|---|---|
| T1 | 任一厂商发布新旗舰模型 | D 域全部分数与价格、master doc 8 维表 | 新模型分数只认官方系统卡;旧分数标注"已被取代" |
| T2 | 任一官方 pricing 页变动(涨或降 >20%) | cost_precision 全部账单、四档预算 | 重跑账单表;检查"订阅 vs 按量"结论是否翻转 |
| T3 | 任一免费层/公测结束公告(智谱 2026-08 前科) | 阶段 0 免费池、教学装 | 免费池替换方案 24 小时内更新 |
| T4 | CAC / 任何监管机构新规生效 | 五大场景红线、security 附录 | 重走合规清单;红线变化写入 final CHANGELOG |
| T5 | 所用工具 major 版本更新或归档(Continue 归档误判教训) | ROUTE.md 命令 | GitHub API 确认 archived + pushed_at;命令重测后更新 |
| T6 | 新一轮 CVE 涉及 agent/MCP 工具链 | security 附录 | 评估是否影响白名单;必要时升级/替换 |
| T7 | 自家评测套件连续 2 期跌破基线 | 全部"系统在进步"结论 | 先查模型静默升级(T1 交叉),再查任务集过拟合——顺序不可颠倒 |
| T8 | 代充/支付渠道风控事件(阿里禁用 Claude Code 先例) | J 域购买渠道表 | 渠道风险等级重评 |
| T9 | CAISI / METR 发布新一期官方数据 | 中美差距、翻倍周期、时间地平线 | 用新官方口径替换,废弃第三方转述 |
| T10 | 被引论文被撤稿/证伪 | 对应域结论 | 全链路降级并在本账本标"已证伪" |
5. 监控清单(可执行,freshness §4 原样保留并绑定本账本)¶
5.1 月度(每月 1 日,约 30 分钟;最简版只做 ③④,约 5 分钟)¶
# ① 价格抽查(3 家代表厂商官方页人工过一遍)
# deepseek.com/pricing bigmodel.cn/pricing siliconflow.cn/pricing
# ② 免费额度抽查:同一批官网页的"免费/新用户"区块
# ③ 核心工具版本漂移:
for r in ollama/ollama promptfoo/promptfoo HKUDS/LightRAG qdrant/qdrant mem0ai/mem0 browser-use/browser-use; do
curl -s https://api.github.com/repos/$r | jq -r '"\(.full_name) \(.stargazers_count)★ pushed=\(.pushed_at) archived=\(.archived)"'
done
# ④ 自查:final/ 里所有标 H0/H1 且验证日期 >45 天的条目 → 触发重查
# (按本账本"验证日期"列 + 半衰期列筛)
月度输出追加到 final/CHANGELOG.md,一行一条:日期 | 变了什么 | 影响哪份文件 | 已更新✅/无变化。
5.2 季度(每季首月,约 2 小时)¶
- GitHub 健康度全量:github_checks.json 里 44 个仓库全部重跑,与旧值比对(archived=true 或 pushed_at 停滞 >6 个月 = 降级)。
- MCP server 白名单三条件:近 90 天 commit / issue 响应 / vendor 背书,不达标者移出并找替代。
- benchmark 分数对手系统卡:master doc 引用的每个模型分数核对官方系统卡;聚合板数字全部加日期重验。
- judge 校准:30 例一致率 ≥85%,跌破则改 judge prompt(I 域规则)。
- 监管快照:CAC 官网 + Concordia AI 季报过一遍,新增法规补进安全附录。
- 厂商切换演练:假设主力 API 消失,计时恢复 3 个核心任务(目标 <30 分钟);记录实测耗时替换"2 小时"修辞。
5.3 半年(重点:H3 级结论存活性 = F18–F23 逐条)¶
- 重读反方报告(counterarguments + redteam_optimism)逐条问:这条反对论据今天还成立吗?
- 论文存活检查:C 域承重预印本是否已过同行评审 / 被证伪(= A8,下次 2026-12-21 起季度执行)。
- 盈亏平衡重算:最新价格 + 当前实际用量重算平衡点表(cost §4.2 代码口径,= F20)。
- "个人做不到"清单复核:每条找到仍然成立的最新证据才保留(= F23)。
5.4 事件驱动订阅源¶
| 信息源 | 监控什么 | 频率 |
|---|---|---|
| 各厂商官方博客/公告(DeepSeek/智谱/Moonshot/OpenAI/Anthropic) | 新模型、价格、政策、弃用 | 每周 |
| support.claude.com 政策文章顶部 Update 声明(= A2 条目 15036540) | 计费/封号政策翻转(X4 教训) | 每周 |
| CAC 官网 + GB 标准公告 | 新规、执法通报 | 每月 |
| metr.org + nist.gov/CAISI | 官方评估数据更新 | 每月 |
| CVE.org / NVDB(关键词:MCP, agent, Claude Code, browser-use) | 新漏洞 | 每月 |
| OpenAI/Anthropic model deprecation 页 | 模型退役通知(前科:2 周通知期) | 每月 |
| 中文圈一手渠道(厂商中文博客/公众号/社区) | A11 缺口补源 | 每周 |
6. 降权项 X 对账收口(verify 各节结论带入)¶
| X 项 | 状态 | 依据条目 |
|---|---|---|
| X3(GLM-5.2 分数) | 结案:统一 62.1%,删除一切 68.5% 引用 | A1 |
| X4(Agent SDK 计费分离) | 结案:由"监控中"升级为"已核实暂停";成本结论按现行订阅统一计量改写 | A2 |
| X8(Zep CE 弃更) | 结案:单源升级为一手+多源;自托管推荐链 = Mem0 / Letta / Graphiti(自备图库) | A4 |
| X10(Hendrycks 27/57) | 前半结案:补正式引用 arXiv 2510.18212;"微软协议 AGI 出现 8 次→0 次"仍未核实,维持降权 | A9 |
| X11(聚合分低置信) | 部分收口:默认规则维持;已有一手锚的数字(GLM-5.2 62.1 / Opus 4.8 69.2 / Opus 4.8 $5/$25)标注"已对官方卡核实"后可用;Fable 5 / Mythos / GPT-5.6 / Qwen3.8 Max / Kimi K3 等其余新代号分数仍低置信,逐一对系统卡后方可入 Master | A6 |
| X13(OX Security) | 部分结案:引语改 "expected behavior";40+ CVE / 24,008 泄露密钥 / 492 裸奔 server 三项仍无一手,维持降权 | A10 |
| X14(Bankrbot 金额) | 部分结案:入 Master 必须写区间 $150K–175K 并标"SlowMist 原帖未直读";METR $600K 剔除或标"未核实" | A7 |
| X5(2025 H2 封号数据) | 维持:已被 2026 H1 数据取代(F15 为现行口径) | F15 |
| X1/X2/X6/X7/X9/X12/X15/X16 | 本轮未触及,维持 Round 2 原判 | — |
7. 账本统计与自我锐评¶
- 账本规模:A 组 12 条(verify B1–B12)+ F 组 28 条(freshness 赋值表 + H∞ 数学条)= 40 条;无一条缺验证日期或缺半衰期(未验证项 A5 标"低置信/未验证"、已定案项 F4 标"已定案",符合状态枚举)。来源缺口披露:verify.md 原文缺 §11(B11 详述节,编号从 §10 跳至 §12),B11 仅据其汇总表一行带入账本 A11——引用时按"低置信/监控项"对待。
- 对账结果:双侧一致 24 / 单侧覆盖 14 / 实质冲突 2(R1 取更短半衰期、R2 价格待官方页裁决)。
- 锐评(freshness §6 带入):① 半衰期赋值是判断不是测量,监管类 H2=6 个月在 7-15 新规前科面前偏乐观(T4 对冲);② 月度 30 分钟监控对"傻瓜用户"仍偏重,最可行降级 = 只做 5.1 ③④(约 5 分钟),价格靠账单异常被动发现;③ 未覆盖港台/海外读者(时效结构完全不同),需按 gaps §9.9 单独分叉。
- 最危险的三条(引用前必查):A2(H0 政策随时恢复)> F1(H0 硬件一日一价)> A6-R2(GLM-5.2 价格未裁决)。
合并完成于 2026-09-21。本账本半衰期:方法级(schema/触发器/监控流程)H2=6 个月复核;账本内具体数字随各自半衰期独立过期。