# MASTER.md — 个人用户逼近 AGI：最终判定与能力边界（主文档）

> 版本：final v1.0 ｜ 判定基准日：**2026-09-21**（CST, UTC+8）
> 语言纪律（全项目统一，依 H 域 §11 裁决）：不用裸 "AGI" 一词，统一 **performance × generality × autonomy** 三轴语言；所有"逼近"声明必须绑定具体任务分布 + 可复现评测。
> 时态纪律（Round 3 critic #8）：全文凡"现行/当前/最新"一律读作 **"截至 2026-09-21 验证"**。价格/模型/政策类结论的半衰期为 1 周至 3 个月（H0-H1），读者使用当天必须按 `APPENDIX-facts.md` 监控表重查，不得信任本文快照。
> 文档族谱：**本文件 = 判定与边界**；ROUTE.md = 傻瓜式步骤；CHECKLIST.md = 打卡清单；APPENDIX-scenarios / cost / security / facts = 四本账册。数字只在此处给出判定口径，步骤细节一律去 ROUTE.md。
> 数字纪律：承重数字绑定三元组（来源类型，口径，验证日期）；半衰期分级 H0≤2周 / H1 1-2月 / H2 3-6月 / H3 6-24月 / H∞ 结构性（freshness.md §1 为母本）。

---

## 0. 本项目的验证等级声明（不可删除，引用本文必须带上）

| 证据档 | 定义 | 本项目实际占有 |
|---|---|---|
| **案头推理** | 文献转述、双引擎检索、GitHub/arXiv API 直查的纸面交叉验证；来源实存但没人实跑过方案 | Round 1/2/3 全部其余材料（约占 95%） |
| **单机实证** | 在一台真实机器上手跑出输出 | **仅一处**：round2/novice_test 的 6 条测试（Kali VM, CPU-only, 2026-09-21），产出 11 个卡点 |
| **独立复现** | 第三方在无关环境复现关键数字 | **0** |

由此得出的三条推论（本声明是全文档的立约条款）：

1. **这是一个案头推理档的调研**。唯一"什么都当真、直接跑"的轮次（novice_test）恰好产生了全项目信息密度最高的纠错——11 个卡点里 6 个属于"教程会教、实测必炸"（promptfoo provider 语法、LightRAG 维度炸、PEP 668、端口裸奔、cron 静默失败、假版本号）。**实测档证据在本文档中的权重最高**，纸面推理在这之上的每一步推论都要打折。
2. 因此本文全部"做得到 / 做不到"是**"设计了，未验证"**：验收标准写在纸上，任何一项都没有在真实用户身上执行过。把纸变成数据的动作 = ROUTE.md 第 0 周的**自证实验**（用户拿自己的 10 个真实任务做计时/质量对照）。
3. 支持侧结论相应**降级为"待自证假设"**（见 §1.1）。这不是态度严谨的修辞——是按本项目自己的证据纪律（五原则第 1 条"寻找支持论据"、严禁编造）执行后的必然结果：正面命题的第一手证据目前是空集。

---

## 1. TL;DR 判定

**一句话**：个人用户用现有（2026-09）工具，**可以拼出一套在某些任务分布上逼近前沿模型表现的"监督式增强系统"**——这一命题是**待自证假设**而非已验证结论；同时存在 4 条被实证击穿的能力硬边界和 3 类被复合红队证实的系统性风险。**先读边界和风险再起手**：起手顺序错误时，损失的是钱和持续动力，不是时间。

### 1.1 支持侧 → 降级为"待自证假设"（critic #2 落实）

盘点 Round 1→3 全部材料中"个人用户真的逼近 AGI 了"的正面证据：

| 候选正面案例 | 出处性质 | 判定 |
|---|---|---|
| jangwook.net 博客个人自动化 $80/月 | 个人博客，单源 | 不可复现的单源叙事 |
| "6 周平凡教训" 时间线 | 跑成者博客 | 幸存者偏差（redteam C1 已承认）——跑崩的不发帖 |
| Nubank 600 万行迁移 | 厂商自报 | 企业案例，非个人 |
| Devin $26B 估值 / Anthropic +90.2% | 厂商自报内评 | 企业 + 自报，不可独立复现 |
| **个人 + 第一手 + 可验证** | — | **数量 = 0** |

需要对称的对冲：**发表偏差同时腐蚀两侧**——个人成功者沉默（不发帖、发了不可复现），失败者更沉默。这削弱的是"支持侧结论可以用肯定语气写"的合法性，不是支持方向的合法性。因此本文的最终措辞是：

> **支持侧判定（待自证假设）**：每个能力环节都存在实存、活跃、经一手验证的工具栈（§2），足以支撑"**路线没有结构性死点**"的方向性判断；但"照做就会逼近"作为整体命题**没有任何第一手用户级证据**，其成立与否由每名读者在自证实验中自行裁决。

### 1.2 反对侧 → 经三轮打击后仍然站立的边界

三份批评文书（counterarguments / redteam_optimism / critic）的 59+8 项判定全部收敛后，反对侧残余的是**实证级**而非修辞级结论（详见 §4.2）。注意 Round 2 曾把"验收文化是 Round 1 最强防御资产"记为方法论遗产——**critic #4 证明这是自我庆功式误读**："报告作者诚实标注了缺陷"不等于系统在用户手里被验收过。本文的措辞统一为：**验收在设计中已建立，在执行中未验证**。

### 1.3 可行解（架构师估计，锚 §2）

个人 2026 年（截至 2026-09-21）能拼出的最强形态 = **"高 generality 工具 + 受限 autonomy + 唯一真相源记忆 + fail-closed 验收"的监督式增强系统**，而不是全自主数字员工。它有四个不可拆的组件：

1. **钱先花在评估侧**——每个闭环的上限 = 验证信号能分辨的最小质量差；
2. **防御做在模型外**——沙箱 → 权限白名单 → 人审 → 审计 → 回滚，模型层对 prompt injection 无解；
3. **成本反脆弱**——订阅月付 + 闲时批处理 + 缓存命中 + 至少 2 家厂商 key + 本地兜底（本地只买隐私/离线/微调，不买省钱）；
4. **人必须始终在验收位上**——系统的价值依赖主人持续在场，放手不管的部分会静默失败而不是报警。

---

## 2. 八维能力模型（critic #1 后的区间版）

### 2.1 区间的构成程序（为什么不写单一百分数）

Round 2 骨架的 8 维单值可达度（55%/80%/30%…）被三号批评家击穿：这些数字**没有构成方法论**，披着精确外形的"架构师主观估计"比〔单源〕博客更有骗性。本版本做三处降级：

1. **单一百分数 → 区间**：下限 = 只用零成本/最省配置（官方网页、免费 API 池、本地小模型）的读者，锚定可复现公开实证；上限 = 走完阶段 0-5 + 订阅旗舰 + 90 天运维纪律的读者，锚定文献说好的部分再打折（考虑到不同实验/口径随时翻转，留一档缓冲）。
2. **判定从百分数改为三档**：可行（装环境即可用）/ 勉强（要持续操盘才成正资产）/ 不可行（个人条件下不要投入）。百分数仅作横维参考，不是测量值。
3. **每维标注锚点等级**：【实测】= novice_test 跑过；【一手】= arXiv/官方文档/官方 API 直读；【双源】= 两独立引擎一致；【单源】= 未交叉（只作线索）；【架构师估计】= 无方法论的主观插值。

### 2.2 主表

| # | 维度 | 区间（架构师估计） | 三档判定 | 下限锚（只装到这里时） | 上限锚（全栈 + 纪律时） | 上限为什么不是 100%（残余反方） |
|---|------|:---:|:---:|---|---|---|
| 1 | **推理/规划/代码** | 40–60% | 可行（借旗舰 API） | 官方网页/免费 API，直接可用 | 前沿 API + 好的器载（harness）+ 回归评测 | 心理测量标尺上 GPT-5 = 57%（GPT-4 = 27%，Hendrycks et al., arXiv 2510.18212【一手，验证 2026-09-21】）；SWE-bench Pro 数字只在 Scale 标准化板内可比，聚合板之间相差 10+ 分（morphllm 页实证；I 域三榜三个第一名）；个人硬件可跑档比前沿差 1-2 代（D 域 L2 结构，【双源】）。因此"拿公开分数导航选模型"本身就被禁（冲突 6 裁决） |
| 2 | **记忆** | 65–85% | 可行 | Obsidian+本地向量检索（obsidian-mcp / sqlite-vec），全免费【实测链路】 | 跨会话持久记忆 + 月度审计 + 知识图（仅多跳需求出现才上） | 演化/合并/冲突消解仍最薄弱（A 域 §5.3）；记忆写毒是持久信任根风险（redteam A3 赢一半：写权限默认走 proposals 人审）；RULER"标称窗口≈2-4×有效窗口"是 2024 旧模型数据，新 1M 档模型已收窄（冲突 3 裁决）——分层结论保留，倍数证据降级 |
| 3 | **执行/动手** | 40–60% | 可行（浏览器短任务）/ 不可行（全自主长程） | browser-use/Playwright MCP 做只读与受控表单 | 围栏内写操作（sandbox+白名单+审计+回滚后） | **乘法墙是 H∞ 级障碍**：单步可靠 90% × 15 步 = 20.6% 完成率；OSWorld 2.0 上 Claude Opus 4.8 二元完成率 20.6%（部分分 54.8%）、GPT-5.5 ≈13%（arXiv 2606.29537【一手，验证 2026-09-21】，108 长程工作流/人类中位 1.6h/任务）；工具描述层 97.1% 存在缺陷（arXiv 2602.14878【一手，X16 补编号后结案】）；官方 SDK 同源缺陷 + 11 CVE + ~200K 暴露实例（OX Security 披露，量化经 verify B10 双源升级；Anthropic 回应原话为 **"expected behavior"**（经 OX 转述），消毒责任在开发者——"by design" 引语作废） |
| 4 | **学习（持续改进）** | 20–40% | 勉强 | prompt 层 + 人工策划技能库 | 月度 GEPA 重优化 + promptfoo 回归门（fail-closed） | **硬上限有三**：① LLM 自生成技能 +0.0pp（SkillsBench, arXiv 2602.12670【一手】，相对人工策划 +16.2pp）；② 个人化纯 PEFT 学知识 ≈ 白训（+1.07%，CIIR LaMP 37k 适配器研究, arXiv 2409.09510【一手】；+RAG 组合才 +15.98%）；③ 递归自训练必然塌缩（Nature 2024 / ICLR 2025 replace 范式【一手文献链】）。可行收益被限定在：格式/行为/领域判别固化 + 核心 prompt 月度再优化（GEPA, ICLR 2026 Oral【一手】） |
| 5 | **创造（新信息/新工件）** | 25–45% | 勉强 | AlphaEvolve 式开源子程序进化器跑起来 | + 域数据灌注（RAG）后做半结构化知识整理 | "推理层以增量方式造出新信息"目前证据 ≈ 0（SkillsBench 自生成 0；"More Convincing, Not More Correct"：judge pass 0.72→0.94 而 accuracy 恒 0.20，arXiv 2607.05904【一手】）——**看起来更有说服力 ≠ 更正确**；AI 产研究的真结果存在但噪音大（C 域 §5 判定），个人档只能做"进化子程序/整理证据"级别的创造 |
| 6 | **社交/协作（多智能体）** | 40–60% | 可行（读并行+审环）/ 不可行（自由 swarm） | 双代理评审环（读并行、写单线程） | fan-out 读并行 + 单线程写 + 评审环 + 可观测性 | 分工裁决（冲突 2/10）：广度读密集任务多智能体收益为真——**但唯一硬数字是 Anthropic 自报内评**（+90.2% 研究类任务、15× token、官方原文自己承认编码任务不可泛化【一手】）；MAST 1,642 条轨迹 14 失败模式，Agent 间协调是最大失败类之一（arXiv 2503.13657【一手】+ 数据集 mcemri/MAST-Data 实存【一手，verify B12】）；写并行被 Cognition 与 MAST 双重实证否定 |
| 7 | **自主性（24/7）** | 30–50% | 可行（围栏内定时）/ 不可行（发现任务） | cron + 心跳常驻，新手实测 cron 19/19 次成功【实测，2026-09-21】 | 渐进三级只读→受控→围栏内自动（近 60 天审批 >95% 才升级） | 两条硬约束：① "agent 自己发现任务"的所有成熟实现里，规则全部是人写的（G/E/H 跨报告一致，无反例）；② 长程全自主撞乘法墙 + H"长程不可靠"第一反方未被推翻。心跳成本 ~$0.015/天【单源，维持降权】；升级过快被红队 E5 击中（写操作人审无豁免条款） |
| 8 | **自我认知（评测/监控）** | 55–75% | 可行 | promptfoo + 30 题金标准集（<$10/月）【测试通过，2026-09-21】 | 月度仪表盘四件套 + 季度 judge 校准 + 第三方盲评 5 对 | LLM-as-judge 五重陷阱：judge pass ≠ accuracy（0.94 vs 0.20 实证【一手】）；红队判 I1/C4 为"全文最硬一枪"——阈值曾经 ±2pp 低于 30 题套件的单题粒度 3.3pp，仪表盘失去刻度，**修复后口径 = 阈值 ≥2 题（≥6.7pp）+ 连续 2 期同向**；dashboard.py 仍是"写了没跑"（verify B5 未验证） |

### 2.3 综合画像与"最强形态"边界

- **总体上，个人条件下的能力上限最容易被"评测信号分辨率"与"单步可靠率的乘法结构"两个量封顶**——这两条都是 H∞ 级原理，不会因模型或工具热潮而改变。
- 8 个维度中，**2（记忆）、8（评测）两个维度上个人可以做到"接近专业人士水准"**（可行性证据最固化）；7（自主性）、4（学习）是两个"看起来最诱人、实际最破"的维度，投入产出比最低，放在路线图最后并默认跳过权重级部分。
- 综合画像为"**人在闭环里的监督式增强系统**"：个人不可复制的是 model 的 generality，个人可复叠在系统上的是 memory 的 persistence、executable 的 reliability（在围栏内）、evaluable 的 honesty。

---

## 3. 三条贯穿性架构原则（H∞，原则级，六个月半衰期起步）

### 原则 1：钱先花在评估侧（C §6.2 判定）

每个改进闭环的上限 = 评估信号能分辨的最小质量差。**验证器分辨率是天花板，不是算力、不是模型**。落地为三件套（I 域 + 修复项）：
- 金标准任务集：30 题，其中 ≥30% 来自**真实失败案例**（不是理想场景）；
- 判读阈值：**≥2 题（≥6.7pp）** + 连续 2 期同向才算信号（30 题单题粒度 3.3pp，数学上不可突破）；
- 锚点陷阱：藏 5 题"绝对不该通过"的题，通过率 >0 = 题目已泄漏，整套任务集作废重建（redteam 1.3-b/1.3-a 补进）。

### 原则 2：防御在模型外（E §7.0 不变式）

prompt injection 在模型层无解（OpenAI 原话 "may never be fully solved"），MCP 生态实务佐证：30k server 中 62% 零维护、官方 SDK 同源缺陷 + 11 CVE、~200K 暴露实例（verify B10 量化，双源）。安全必须做在 harness/runtime/网络层，顺序固定：
**沙箱 → 权限白名单 → HITL 人审 → 审计日志（JSONL 可重放）→ git 回滚**。不可逆操作（付款 / 删库 / 对外发布）永不自动，无豁免条款。

### 原则 3：成本反脆弱（H3/12个月）

分层模型路由（70% 任务走便宜模型）+ 订阅月付 + 闲时批处理 + 缓存命中 + 至少 2 家可用 key每季度演练切换。**限定语（redteam H3 赢一半，必须带上）**：这套组合令"钱"的支出结构稳定，不令"能力上限"稳定——补贴退坡时成本几乎不动，但可用的智能上限会随省下的钱一起下降。

国内现价锚点（全部【一手】，2026-09-21 官方页实拉，详见 APPENDIX-cost）：DeepSeek V4-Flash 缓存命中闲时 $0.003/M（官方直连）；硅基流动 GLM-5.2 8/28 元/M；GLM-5.3 现价 6/28 元/M（模型中心快照，未涨价）；智谱 GLM Coding **V1 老用户 49/149/469 元续费**（V2 新价 118/538/1078，涨价潮之下 V1 续费是当前全市场最优单笔订阅）；火山方舟 Coding Plan 限时 9.9 元起。

---

## 4. 做得到 / 做不到边界

### 4.1 做得到（每条附证据锚与验证等级）

| 能力 | 需要的条件 | 证据锚 | 等级 |
|---|---|---|---|
| 监督式工具栈（CLI agent + AGENTS.md + 沙箱） | 订阅或免费 API、一台普通机器 | Round 1 B/E/G 三域方案 + novice_test 环境链路 | 方案已设计【案头】+ 环境层【实测】 |
| 私有回归评测套件 | promptfoo + 30 题 | novice_test 测试 3 跑通（provider 语法已修）【实测】；round2 redteam 1.3-d：目标降级为"回归检测"后攻击未破 | 【实测工具层】 |
| 跨会话个人记忆 | Obsidian + 本地向量库 + MCP 化记忆 | 能力建立的判决依据（跨会话状态无可替代）为 H∞ 原则，A 域阶段 0-3 免费 | 【案头 + 原则级】 |
| 浏览器受控执行（≤15 步、明确验收） | browser-use / Playwright MCP | 单步短任务 80-97% 可靠（E 域，自报口径，judge 不可比）【单源/自报】 | 【单源降权】 |
| 域专精/个人知识注入 | 个人资料 + RAG（不是微调） | +15.98%（RAG+PEFT 组合）vs 纯 PEFT +1.07%（CIIR, arXiv 2409.09510【一手】） | 【一手】 |
| 技能层 prompt 工程 | 人工策划技能库（非自生成） | +16.2pp（SkillsBench【一手】） | 【一手】 |
| 核心 prompt 的季度级再优化 | GEPA 开源器 | 超_GRPO 平均 +6%、最高 +20%、rollouts 省 35×（ICLR 2026 Oral【一手】） | 【一手】 |
| 围栏内 24/7 定时任务 | cron/心跳 + 断路器 + 审计 | novice_test cron 19/19、全套基础设施组件活跃【实测 + 一手】 | 【实测 + 一手】 |
| 月账单可控（国内） | 零元-轻档 0-50 元、订阅档 40-200 元 | cost_route §3 全表现场校验【一手，2026-09-21】 | 【一手价格，H0-H1 半衰期】 |

### 4.2 做不到（反对侧硬边界，实证击穿后仍然站立）

| # | 边界 | 击穿证据（含等级） |
|---|---|---|
| 1 | **从零训练基座模型** | 算力鸿沟 8-9 个数量级（DeepSeek V3 训练 $5.576M【一手技术报告】）；LeCun"LLM 之外还有数量级鸿沟"论点未被任何新证据推翻 |
| 2 | **全自主长程 agent（无人兜底）** | 乘法墙（数学硬结构）；OSWorld 2.0 最佳 20.6%【一手】；"agent 发现任务"零成熟实现【跨报告一致】；断/卷人审（HITL）被三域红线一致要求不可豁免 |
| 3 | **权重级自我提升飞轮** | replace 范式必然塌缩（Nature 2024 / ICLR 2025【一手文献】）；个人数据反哺 ≈ 复刻教师知识，无法超越；LoRA 学"形式"不学"事实"（F 域自我承认，与 H 域裁决一致） |
| 4 | **个人化 PEFT 学知识 / 注入新事实** | +1.07% 接近零（CIIR【一手】）；"低且不稳"（F 反向确定）；对少数确定有收益的场景（格式固化 / 隐私推理）才值得投入 |
| 5 | **评测集"防污染"** | 命题降级为"私有回归检测"（redteam 1.3-d：回归告警成立、防污染 overclaim）——题集走 API 即在供应商训练管道内，opt-out 与锚点陷阱是仅有的低成本防线 |
| 6 | **对免费层的长期依赖** | 免费层退坡是实证而非预测：Gemini CLI 免费层 2026-06-18 断供、OpenAI 免费层广告化+限额收紧【双源】；"0 元装"只能当教学装 |
| 7 | **封号后靠工单恢复** | Anthropic 申诉翻案率 3.3%（2025 H2）→ 10.6%（2026 H1：11.4M 封禁 / 398k 申诉 / 42k 翻案，官方 Transparency Hub【一手，X5 已更新】）；备份 key 的连坐风险要求"活体验证"（不同网络/邮箱/支付通道，每月真实调用一次，未验证的不算备份） |
| 8 | **"验收=自动执行"的信仰** | 装了验收不等于会去验收（redteam E4/A1 + critic #4）；任何把"每周导出/月度审计"写进承诺但人不会去点按钮的机制，实际保护为零（J5：对话史无导出 API，cron 化承诺在核心对象上不存在） |
| 9 | **按公开榜单选模型** | SWE-bench Verified 已被 OpenAI 官方弃用（2026-02-23 公告，59.4% 缺陷【一手】）；Pro 分数只有 Scale 标准化板内可比，同一基准三榜三个第一名；**唯一正确用法 = 自建任务集 + 官方系统卡抽查**（冲突 6 裁决，I 域） |

### 4.3 国内 / 海外读者分支声明（critic #6 落实，全部 final 文档共用）

本文核心架构证据（METR 时间地平线、OSWorld、MAST、CIIR/LaMP、τ-bench pass^k、SkillsBench）**全部来自英文世界与海外厂商的公开研究**——这是语料的结构性现状，不是选偏。它带来的命题级风险：如果国内 API 的可靠性、合规环境（内容审核对 agent 工作流的截断、备案边界）与海外显著不同，本文结论对目标读者（中国大陆个人用户）**不可整机迁移**。处理方式（诚实分级）：

- **已做一手校验的**（可放心引用，但注意各自半衰期）：国内直连层（DeepSeek api.deepseek.com / Qwen dashscope / Kimi api.moonshot.cn / GLM open.bigmodel.cn / 豆包，全部无需代理【单源_tech社区 + 官方域名事实双重印证】）、订阅与 API 价格（cost_route 全表，官方页当日实拉【一手】）、盈亏平衡点（个人达不到，结论维持【双源+精算】）。
- **只有方向性判断的**（按低置信处理）：生成式 AI 管理办法的执法边界、中转站长期稳定性、内容审核对自动化工作流的具体截断率。**这三项没有同级定量研究，国内读者在自证实验的 10 个任务里自然会碰到——碰到什么记什么**，这比本文任何推断都准。
- **海外/可直连海外读者分支**：OpenAI/Claude 官方 API + 海外订阅正常可用；但封号风险数据（4.2-#7）需要计入，且所有"个人 token 账单结构"结论必须按"Agent SDK 计费拆分已暂停未生效"的现行状态计算（verify B2：官方帮助中心原文 "For now, nothing has changed"【双源，2026-09-21】；**重启时间未定，官方承诺提前公告**——若重启，SDK 重度用户成本将从订阅池跳到按牌价计的独立 credit）。

---

## 5. 证据品质账本（审计降权过滤的结账）

### 5.1 X1-X16 降权过滤器结账表

每个曾被打上降权标记的数字，进入本文档前必须在此表中被"处置"——**没有出现在此表的任何 Round 1 数字不进入 MASTER 判定层**：

| # | 项 | 处置结果 | 结案依据 |
|---|---|---|---|
| X1 | Continue 仓库"已归档" | **更正撤销**：实测 archived=False、2026-09-20 仍 push | audit GitHub 直查 |
| X2 | claude-code ★~14k | **更正**：146,990★（差 10 倍，不影响"活跃"结论） | audit GitHub 直查 |
| X3 | GLM-5.2 SWE-bench Pro 分数两说 | **结案：62.1% 为唯一可信数字**（官方 model card + z.ai 博客 + 三方独立源全部 62.1%，零源支持 68.5%）；"开源第一"仅指 SWE-bench Pro 开源权重第一，整体次于 Opus 4.8（69.2） | verify B1【一手】 |
| X4 | "6-15 SDK 计费分离已生效" | **更正**：宣布后已暂停（"For now, nothing has changed"），现行仍是订阅统一计量；重启时间未定 | verify B2【双源】 |
| X5 | Anthropic 封号数据过时 | **更新**：2026 H1 = 11.4M 封禁 / 398k 申诉 / 42k 翻案（10.6%） | audit 官方 Transparency Hub【一手】 |
| X6 | Paperclip 53k★/6周 | **更正**：81,124★（2026-09-20 GitHub 实测） | audit GitHub 直查 |
| X7 | 内容农场互抄被标 both | **系统性降权**：凡仅由 C 层（内容农场）支撑的 both 标签一律按 single 处理；本文引用的核心数字全部改绑一手/独立双源 | audit §3.1 |
| X8 | Zep CE 弃更未核验 | **结案**：官方 FAQ 原文证实弃更，产品仓转为示例/集成；自托管路线只剩 Graphiti 引擎 + 自备图数据库（Neo4j/FalkorDB/Kuzu） | verify B4【一手+双源】 |
| X9 | claude-mem/MemPalace star 增长自然性 | **部分结案**：星数/创建日/活跃度一手真实；增长自然性因无 token 不可核查，"本地文件派登顶/个人 agent 霸主"叙事降格为"星数高企且项目活跃属实，增长自然性未审计" | verify B3【一手+低置信双标注】 |
| X10 | Hendrycks 27%/57% 单源 | **升级为一手**：arXiv 2510.18212《A Definition of AGI》PDF 原句命中（27%=GPT-4、57%=GPT-5、"长时记忆是最大短板"为原文论断）；"微软协议 AGI 8 次→0 次"仍维持降权 | verify B9【一手】 |
| X11 | 全部新代号第三方聚合分数 | **原则维持**：默认低置信；仅两个已对官方卡核实（GLM-5.2 Pro 62.1、Opus 4.8 Pro 69.2 + $5/$25 计价）可用；Fable 5 / Mythos / GPT-5.6 分数等其余仍禁入；GLM-5.2 价格三说不一待官方 pricing 页 | verify B6【部分一手锚】 |
| X12 | 57% 假数据 / $1040/篇 / 21% AI 评审 | **维持降权**（二级转述） | audit 维持 |
| X13 | 40+ CVE / 24,008 泄露密钥 / 492 裸奔 server | **维持降权**（数字未复核，方向可信，只作风险量级参考，不作引用）；"by design"引语作废，改为 "expected behavior"（经 OX 转述）；OX 披露的量化（4 SDK 缺陷 / 11 CVE / 7000+ 暴露 / 150M+ 下载 / ~200K 实例 / 6 平台实证被攻破）经 B10 双源升级可整体引用 | verify B10【部分结案】 |
| X14 | Bankrbot $150K / METR $600K 金额 | **部分结案**：Bankrbot 事件链双源坐实，金额改区间 "$150K–175K（口径不一，链上可查）"，注 SlowMist 原帖未直读；**"METR $600K credits" 从本文档剔除**（未核实） | verify B7【部分】 |
| X15 | M5 Ultra / Spark / RTX60 路线图 | **维持降权**（媒体转述无官方规格页）；叠加 2026 涨价周期（内存年涨 3 倍、SSD +56%、缺货至 2027H2），"等 60 系"策略已死；5 万预算正确姿势 = 4 万存理财 + 按需云租（4090 1.3-2.5 元/h）+ 1 万内年度订阅 | cost_route 现场【一手行情】 |
| X16 | "856 工具 97.1% 缺陷"缺编号 | **结案**：实为 arXiv 2602.14878（103 server × 856 tools），补编号后升级【一手可查】 | verify B8 同批次 |

### 5.2 十组冲突裁决的影响落点（Round 2 conflict_adjudication → MASTER 条款）

| # | 冲突 | 裁决 | 在本文的落点 |
|---|---|---|---|
| 1 | 本地 vs 云成本 | 双方都对但平衡点口径不同（D 2-5M tok/天=裸算力；J 110亿 tok/月=含人力全成本），个人用量全部落在 API 赢区 | §3.3 / §4.2：成本反脆弱条款；本地只买隐私/离线/微调 |
| 2 | 多 vs 单智能体 | 任务分族：广度读密集=真收益（+90.2% 自报）；写密集=否 | §2 维度 6 区间上限的构成依据 |
| 3 | 记忆层 vs 长上下文 | 分层成立但按语料规模分档：<100K 直塞 / 100K-500K 新模型直塞可选 / 跨会话必为记忆层 / >500K 或交互场景 → RAG | §2 维度 2 下限锚调整 + APPENDIX 路线 |
| 4 | 微调效果 | 三分法：SFT 格式/分类真 / 个人化 PEFT 近零 / 递归自训塌缩 | §4.2-#3/#4 边界条款 |
| 5 | 本地 vs 前沿差距 | 三层结构维持；修正：K2.5 BrowseComp 78.4% 必须标 **Agent Swarm 模式**（标准模式 60.6%）【一手 + 口径补注】 | 不进本文承重数字，仅 D 域引用 |
| 6 | SWE-bench 可比性 | Verified 弃用 + Pro 三口径分裂；公开分数不可用于选模型 | §4.2-#9 边界条款 |
| 7 | METR 翻倍口径绑定 | 全期 196 天 ≈ 6.5 月；≥2024 口径 **88.6 天 ≈ 3 月**（官方 TH1.1）；≥2023=130.8 天；**16h 以上测量不可靠**（官方原话） | 用法统一："METR 50% 地平线全期约 7 个月翻倍，2024 年以来加速至约 3 个月（88.6 天，官方 TH1.1 口径），16h 以上不可靠" |
| 8 | OpenAI 订阅 $20 vs $24 | 无法闭环，维持中置信，写"$20-24（来源冲突，官方页为准）" | 不进承重数字；APPENDIX-cost 标注 |
| 9 | GPT-5.6 Luna 输出价 D vs J | J 对（官方文档 $1.20/M），D 错 | 价格表锚定规则：**一切价格以厂商官方 API 文档为最终锚点，聚合站只当线索** |
| 10 | Anthropic +90.2% 边界 | 数字真，域限定（自报内评 + Anthropic 原文自认编码不适用） | §2 维度 6 全部条款带"自报"限定 |

### 5.3 承重数字三元组速查（本文档引用的全部一手/双源数字）

| 数字 | 来源类型 | 口径 | 验证日期 | 半衰期 |
|---|---|---|---|---|
| GPT-5 心理测量 AGI 57%（GPT-4 27%） | 一手（arXiv 2510.18212 PDF 原句） | Hendrycks 33 人框架 | 2026-09-21 | H3（12-24 月） |
| GLM-5.2 SWE-bench Pro 62.1% | 一手（HF model card + z.ai 博客） | 官方卡现行表 | 2026-09-21 | H1（基准分 1-3 月） |
| Opus 4.8 Pro 69.2% / $5·$25 计价 | 一手（官方卡 + 5 源计价页） | 官方口径 | 2026-09-21 | H1 价格 / H2 分数 |
| OSWorld 2.0：Opus 4.8 二元 20.6%（部分 54.8%） | 一手（arXiv 2606.29537） | 二元完成率 | 2026-09-21 | H2 |
| CIIR：PEFT +1.07% / RAG +14.92% / 组合 +15.98% | 一手（arXiv 2409.09510 摘要逐字） | LaMP 37k 适配器 | 2026-09-21 | H3 |
| SkillsBench：人工策划 +16.2pp / 自生成 +0.0pp | 一手（arXiv 2602.12670） | 平均，16 任务 | 2026-09-21 | H3 |
| GEPA：+6% 平均 / 最高 20% / 省 35× | 一手（arXiv 2507.19457, ICLR 2026 Oral） | 对 GRPO/MIPROv2 | 2026-09-21 | H3 |
| Anthropic +90.2% / 15× token | 一手（官方工程博客逐字） | **自报内评**，研究类任务 | 2026-09-21 | H2 |
| MAST：1,642 轨迹 / 14 失败模式 | 一手（arXiv 2503.13657 + mcemri/MAST-Data） | 7 框架 / 8 基准 / 5 LLM | 2026-09-21 | H3 |
| METR 88.6 天（≥2024）/ 196 天全期 | 一手（metr.org 官方 TH1.1 表） | 50% 地平线 | 2026-09-21 | H2（新官方数据出现即替换） |
| τ-bench pass^8 ≈ 25%（from ~61% pass^1） | 一手（arXiv 2406.12045） | retail | 2026-09-21 | H3 |
| METR RCT：AI 使完成时间 +19%（自感知 +20%） | 一手（arXiv 2507.09089） | RCT 开发者 | 2026-09-21 | H3 |
| MCP：62% server 零维护 / 11 CVE / ~200K 实例 | 双源（OX 披露链） | 2026-09 快照 | 2026-09-21 | H2 |
| Anthropic 2026 H1 封禁 11.4M / 翻案 10.6% | 一手（官方 Transparency Hub） | 半年报 | 2026-09-21 | H2（2027-01 更新） |
| Agent SDK 计费拆分 = 已暂停 | 双源（帮助中心 15036540 原文 + 17 独立源） | 现行政策 | 2026-09-21 | **H0（随时重启）** |
| Zep CE 弃更 / 自托管仅剩 Graphiti | 一手+双源（官方 FAQ 原文） | 产品线现状 | 2026-09-21 | H2 |
| DeepSeek Flash 缓存闲时 $0.003/M | 一手（官方 pricing 页当日） | 官方直连 | 2026-09-21 | **H0-H1（1 月内重查）** |
| 硅基流动 GLM-5.2 8/28 元/M；GLM-5.3 6/28 元/M（模型中心快照，未涨价） | 一手（官方 pricing 页 + 模型中心当日实拉） | 现价 | 2026-09-21 | H1 |
| 智谱 V1 老用户 49/149/469 续费 | 双源（网易科技 + codingplan.org） | V2 涨价后 V1 存量价 | 2026-09-21 | H0（套餐到期前有效） |
| 火山方舟 Coding Plan 限时 9.9 起 | 一手（官方活动页） | 名额制限时 | 2026-09-21 | **H0（随时结束）** |
| 盈亏平衡：二手 3090 需 9,200 万 tok/月 | 双源+本机精算 | 电价 0.55 元/kWh、4 年折旧、8h 满载 | 2026-09-21 | H3（参数变才重算） |
| Free-tier 退坡实证（Gemini CLI 断供等） | 双源（多事件） | 2026-06 窗口 | 2026-09-21 | H2（方向级） |
| novice_test：6 测试 / 11 卡点 / cron 19/19 | **实测**（本机 Kali VM） | CPU-only 环境 | 2026-09-21 | 工具版本 H2 |

### 5.4 明确"未验证 / 不入账"清单（入档但禁用）

| 项 | 状态 | 处置 |
|---|---|---|
| dashboard.py（I 域仪表盘脚本） | **未运行验证**（环境红线禁装依赖） | 不是"可用工具"；使用前必须在装有 promptfoo 的环境先跑通并人工核对输出 schema |
| METR "$600K credits" 案例 | **未核实**（10 源未命中当事人原帖） | 从本文档剔除 |
| 智谱 V2 积分制下 "120M/600M tokens" 口径 | **不可精算**（积分制 + 90.9% 缓存理想前提，实际可差 2 倍） | 只作量级参考 |
| 火山方舟 Lite 常规月费 40 元 | **单源**（官方页 JS 动态未取到） | 待复核；下单当天以结算页为准 |
| Kimi K3 API 现价 20/100 元 | **未复核**（SF 现价页已无 K3） | 重查后才可引用 |
| OpenAI Plus 订阅 $20 vs $24 | **来源冲突未闭环** | 写区间，官方页为准 |
| 备份 key / 沙箱 / 断路器在"真实用户手中"的实际执行率 | **无数据**（全项目 0 用户研究） | 自证实验补这一行 |

---

## 6. 如何验证自己在进步（最小可行纪律集）

### 6.1 最小纪律集（≤2 项/月，critic #3 的直接落实）

一个要求每月 6-10 项仪式性维护的个人系统，按本项目自己的 A1 判定（"验收过苛把系统失败伪装成人的失败"），第一弃坑窗口 = 第 2-4 周——恰好是纪律最密的阶段 0-1。因此**默认纪律收缩到两条**，所有"进阶项"单独可选、默认不做：

1. **月度重跑 30 题**（10-20 分钟）：跑同一个金标准集，看分数是否跨过 ≥2 题阈值。
2. **账单异常率抽查**（<5 分钟被动触发）：环比异常 >50% 才去查官方价格页——日常不主动盯价格（freshness §6.2 同结论：被动的账单异常 + 5 分钟脚本已够用）。

其余的"月度审计、封号演练、盲评、judge 校准、灾备演练、任务集轮换……"全部降级为**可选进阶**（CHECKLIST 单列，做不做不判定系统成败）。这就是 critic #3 的算术：固定监控成本是小系统最大的隐性税，把它压到"一个人真的会做"的量。

### 6.2 判读规则（红队 I1/C4 修复后的口径）

- **阈值 ≥2 题（≥6.7pp）**——30 题套件单题粒度 3.3pp，±2pp 的"持平"区间在数学上不存在，曾使仪表盘"失去刻度"；
- **连续 2 期同向才算信号**，单月波动不作数；
- **趋势线只看 3 个月**（I 域 §7.5 原则，保留）；
- **盲评胜率判读（样本 20 对）**：≥60% 进步 / ≤40% 退步 / 中间 = 噪声；每月抽 5 对给"没参与项目的人"盲选（第三方对冲自己的风格记忆）；
- **"连续上涨"也要怀疑**：新题（≥20% 季度轮换，且 ≥30% 来自真实失败）与老题**分列统计**，两列差 >15pp = 老题过拟合，不是系统变好（redteam 1.3-b）；
- **自家分数连续 2 期跌破基线时的处置顺序**：先查模型静默升级（厂商公告/官方 deprecation 页），再怀疑任务集过拟合，最后才怀疑工具链（freshness T7 顺序）；
- **用真实生产失败替换 10% 评测集**，不让任务集停在理想场景。

### 6.3 进步的"非仪表盘"检验（给不装仪表盘的读者）

如果连最小纪律集都嫌重，只回答一个问题（季度一次，10 分钟）：**"这个月有没有一件事，是 12 个月前我不会、现在因为系统而在行的？"** 答不上来超过 2 个季度 = 这套系统对你没有产生 generality 增益，应当缩减到常用 3 个任务，而不是反过来加码运维。

### 6.4 首月第一项（critic #8 落实）

**使用本文档的第一个动作不是安装任何东西**，而是：对照 `APPENDIX-facts.md` §F 账本，把本文档全部价格/模型/政策类结论（§3.3、§5.3 中标记 H0/H1 的行）在引用当天重查一遍——本文档的半衰期从交付日 2026-09-21 起算，价格类最多 1 个月、政策类（Agent SDK 计费）随时重启。重查命令与监控清单在 APPENDIX-facts §4（成本 <5 分钟）。

---

## 7. 三号批评家 8 击的落点自查（本文档哪里吸收了哪击）

| # | critic 攻击 | 类型 | 本文落点 |
|---|---|---|---|
| 1 | 8 维可达度无方法论 | 元 | §2.1：单值 → 区间 + 三档定性 + 锚点等级标注 + 构成程序声明；百分比降为"横维参考，非测量值" |
| 2 | 支持侧零第一手证据 | 元 | §0 推论 3 + §1.1：支持侧整栏降级为"待自证假设"；ROUTE.md 第 0 周内嵌自证实验（10 真实任务 + 计时对照），Nature of claim 由"支持"变"假设成立则自证" |
| 3 | 纪律负担 → 弃坑交叉点 | 结构 | §6.1：最小纪律集收缩为 ≤2 项/月；其余全部"可选进阶"；CHECKLIST 不再把全量运维列为默认 |
| 4 | "验收文化"自我庆功 | 元 | §0 推论 2 + §1.2：措辞统一为"验收在设计中已建立，在执行中未验证"；Round 2 判分口径的双标不再被引用为方法论遗产 |
| 5 | 预算建立在补贴价上 | 硬伤 | §0 时态纪律 + §6.4：所有价格标"截至 2026-09-21"+ 首月第一项=重查；APPENDIX-cost 需给出补贴延续/退坡 2×/退坡 5× 三档价格情景（转交该附录） |
| 6 | 中国读者证据错位 | 结构 | §4.3：整机级国内/海外分支声明；已校验/方向性/低置信三级划分；合规截断率明示"无同级定量研究，按低置信" |
| 7 | 收敛轮放大未验证内容 | 元 | §0：验证等级声明三档化（案头推理 / 单机实证 / 独立复现），novice_test 定权重最高，本文档整体标注案头档 |
| 8 | 交付滞后吃掉半衰期 | 硬伤 | §0 时态纪律 + §6.4：全文"现行"改"截至 2026-09-21"；CHECKLIST 首月第一项=重核价格/模型/政策结论（不是信任本文） |

---

## 8. 自我锐评（本文档自身的盲点，保留到下轮）

1. **本文档也是案头推理档**：上述全部"修正"来自纸面交叉，没有任何一条在真实用户上运行过。验证等级声明（§0）对本文同样适用——它把这个问题从"没做"升格为"刻意设计进第一步（自证实验）"，但实验的执行责任仍在读者。
2. **区间仍是无方法论的估计**：8 维区间比单值诚实，但没有脱离"架构师主观插值"的性质； stringent reading 下它只是把不确定性显式化了，不是消除了。若未来出现 3-5 名国内个人用户的真实追踪样本，应该替换本文档的整个 §2。
3. **汇率的单日快照**：全文用 $1≈¥6.75（网易 2026-09 口径）；round2 的 7.2 已过时。人民币破 7.5 时触发式重查（freshness T 序列）。
4. **账本的覆盖度有限**：Round 1 约 200+ 数字级断言，只有互相冲突的 10 组 + X1-X16 + B1-B12 (12项核实) 进入结账；**单报告内部自洽的数字未逐一回溯**（audit 明示的范围外事项）。信任本文的读者应当把"抽查 3 个你不认识的数字"当作阅读习惯而不是例外。
5. **时基都不再是"现状"**：你读到本文的时间 > 2026-10-21 时，本文所有 API 价格与政策快照按半衰期规则已过期一档以上；此时请以 APPENDIX-facts 账本 + 官方页为准，不要以本文为准。

---

*MASTER.md v1.0 ｜ 2026-09-21 ｜ 输入：round2/master_skeleton + verify.md(B1-B12) + conflict_adjudication(10组) + redteam_optimism§4(十条修正) + audit_methodology§4(X1-X16) + cost_route(修正硬件价) + freshness + critic(8击) + novice_test(唯一实测档) ｜ 判定规则：审计降权过滤未结案者不入账 ｜ 下一次全文半衰期复核日：2026-10-21*
