AGI 路线调研终稿 · 2026-09-21 快照
MASTER

MASTER

判定层:8 维能力区间 / 硬边界 / 证据账本

MASTER.md — 个人用户逼近 AGI:最终判定与能力边界(主文档)

版本:final v1.0 | 判定基准日:2026-09-21(CST, UTC+8) 语言纪律(全项目统一,依 H 域 §11 裁决):不用裸 "AGI" 一词,统一 performance × generality × autonomy 三轴语言;所有"逼近"声明必须绑定具体任务分布 + 可复现评测。 时态纪律(Round 3 critic #8):全文凡"现行/当前/最新"一律读作 "截至 2026-09-21 验证"。价格/模型/政策类结论的半衰期为 1 周至 3 个月(H0-H1),读者使用当天必须按 APPENDIX-facts.md 监控表重查,不得信任本文快照。 文档族谱:本文件 = 判定与边界;ROUTE.md = 傻瓜式步骤;CHECKLIST.md = 打卡清单;APPENDIX-scenarios / cost / security / facts = 四本账册。数字只在此处给出判定口径,步骤细节一律去 ROUTE.md。 数字纪律:承重数字绑定三元组(来源类型,口径,验证日期);半衰期分级 H0≤2周 / H1 1-2月 / H2 3-6月 / H3 6-24月 / H∞ 结构性(freshness.md §1 为母本)。


0. 本项目的验证等级声明(不可删除,引用本文必须带上)

证据档 定义 本项目实际占有
案头推理 文献转述、双引擎检索、GitHub/arXiv API 直查的纸面交叉验证;来源实存但没人实跑过方案 Round 1/2/3 全部其余材料(约占 95%)
单机实证 在一台真实机器上手跑出输出 仅一处:round2/novice_test 的 6 条测试(Kali VM, CPU-only, 2026-09-21),产出 11 个卡点
独立复现 第三方在无关环境复现关键数字 0

由此得出的三条推论(本声明是全文档的立约条款):

  1. 这是一个案头推理档的调研。唯一"什么都当真、直接跑"的轮次(novice_test)恰好产生了全项目信息密度最高的纠错——11 个卡点里 6 个属于"教程会教、实测必炸"(promptfoo provider 语法、LightRAG 维度炸、PEP 668、端口裸奔、cron 静默失败、假版本号)。实测档证据在本文档中的权重最高,纸面推理在这之上的每一步推论都要打折。
  2. 因此本文全部"做得到 / 做不到"是"设计了,未验证":验收标准写在纸上,任何一项都没有在真实用户身上执行过。把纸变成数据的动作 = ROUTE.md 第 0 周的自证实验(用户拿自己的 10 个真实任务做计时/质量对照)。
  3. 支持侧结论相应降级为"待自证假设"(见 §1.1)。这不是态度严谨的修辞——是按本项目自己的证据纪律(五原则第 1 条"寻找支持论据"、严禁编造)执行后的必然结果:正面命题的第一手证据目前是空集。

1. TL;DR 判定

一句话:个人用户用现有(2026-09)工具,可以拼出一套在某些任务分布上逼近前沿模型表现的"监督式增强系统"——这一命题是待自证假设而非已验证结论;同时存在 4 条被实证击穿的能力硬边界和 3 类被复合红队证实的系统性风险。先读边界和风险再起手:起手顺序错误时,损失的是钱和持续动力,不是时间。

1.1 支持侧 → 降级为"待自证假设"(critic #2 落实)

盘点 Round 1→3 全部材料中"个人用户真的逼近 AGI 了"的正面证据:

候选正面案例 出处性质 判定
jangwook.net 博客个人自动化 $80/月 个人博客,单源 不可复现的单源叙事
"6 周平凡教训" 时间线 跑成者博客 幸存者偏差(redteam C1 已承认)——跑崩的不发帖
Nubank 600 万行迁移 厂商自报 企业案例,非个人
Devin $26B 估值 / Anthropic +90.2% 厂商自报内评 企业 + 自报,不可独立复现
个人 + 第一手 + 可验证 数量 = 0

需要对称的对冲:发表偏差同时腐蚀两侧——个人成功者沉默(不发帖、发了不可复现),失败者更沉默。这削弱的是"支持侧结论可以用肯定语气写"的合法性,不是支持方向的合法性。因此本文的最终措辞是:

支持侧判定(待自证假设):每个能力环节都存在实存、活跃、经一手验证的工具栈(§2),足以支撑"路线没有结构性死点"的方向性判断;但"照做就会逼近"作为整体命题没有任何第一手用户级证据,其成立与否由每名读者在自证实验中自行裁决。

1.2 反对侧 → 经三轮打击后仍然站立的边界

三份批评文书(counterarguments / redteam_optimism / critic)的 59+8 项判定全部收敛后,反对侧残余的是实证级而非修辞级结论(详见 §4.2)。注意 Round 2 曾把"验收文化是 Round 1 最强防御资产"记为方法论遗产——critic #4 证明这是自我庆功式误读:"报告作者诚实标注了缺陷"不等于系统在用户手里被验收过。本文的措辞统一为:验收在设计中已建立,在执行中未验证

1.3 可行解(架构师估计,锚 §2)

个人 2026 年(截至 2026-09-21)能拼出的最强形态 = "高 generality 工具 + 受限 autonomy + 唯一真相源记忆 + fail-closed 验收"的监督式增强系统,而不是全自主数字员工。它有四个不可拆的组件:

  1. 钱先花在评估侧——每个闭环的上限 = 验证信号能分辨的最小质量差;
  2. 防御做在模型外——沙箱 → 权限白名单 → 人审 → 审计 → 回滚,模型层对 prompt injection 无解;
  3. 成本反脆弱——订阅月付 + 闲时批处理 + 缓存命中 + 至少 2 家厂商 key + 本地兜底(本地只买隐私/离线/微调,不买省钱);
  4. 人必须始终在验收位上——系统的价值依赖主人持续在场,放手不管的部分会静默失败而不是报警。

2. 八维能力模型(critic #1 后的区间版)

2.1 区间的构成程序(为什么不写单一百分数)

Round 2 骨架的 8 维单值可达度(55%/80%/30%…)被三号批评家击穿:这些数字没有构成方法论,披着精确外形的"架构师主观估计"比〔单源〕博客更有骗性。本版本做三处降级:

  1. 单一百分数 → 区间:下限 = 只用零成本/最省配置(官方网页、免费 API 池、本地小模型)的读者,锚定可复现公开实证;上限 = 走完阶段 0-5 + 订阅旗舰 + 90 天运维纪律的读者,锚定文献说好的部分再打折(考虑到不同实验/口径随时翻转,留一档缓冲)。
  2. 判定从百分数改为三档:可行(装环境即可用)/ 勉强(要持续操盘才成正资产)/ 不可行(个人条件下不要投入)。百分数仅作横维参考,不是测量值。
  3. 每维标注锚点等级:【实测】= novice_test 跑过;一手= arXiv/官方文档/官方 API 直读;【双源】= 两独立引擎一致;【单源】= 未交叉(只作线索);【架构师估计】= 无方法论的主观插值。

2.2 主表

# 维度 区间(架构师估计) 三档判定 下限锚(只装到这里时) 上限锚(全栈 + 纪律时) 上限为什么不是 100%(残余反方)
1 推理/规划/代码 40–60% 可行(借旗舰 API) 官方网页/免费 API,直接可用 前沿 API + 好的器载(harness)+ 回归评测 心理测量标尺上 GPT-5 = 57%(GPT-4 = 27%,Hendrycks et al., arXiv 2510.18212【一手,验证 2026-09-21】);SWE-bench Pro 数字只在 Scale 标准化板内可比,聚合板之间相差 10+ 分(morphllm 页实证;I 域三榜三个第一名);个人硬件可跑档比前沿差 1-2 代(D 域 L2 结构,【双源】)。因此"拿公开分数导航选模型"本身就被禁(冲突 6 裁决)
2 记忆 65–85% 可行 Obsidian+本地向量检索(obsidian-mcp / sqlite-vec),全免费【实测链路】 跨会话持久记忆 + 月度审计 + 知识图(仅多跳需求出现才上) 演化/合并/冲突消解仍最薄弱(A 域 §5.3);记忆写毒是持久信任根风险(redteam A3 赢一半:写权限默认走 proposals 人审);RULER"标称窗口≈2-4×有效窗口"是 2024 旧模型数据,新 1M 档模型已收窄(冲突 3 裁决)——分层结论保留,倍数证据降级
3 执行/动手 40–60% 可行(浏览器短任务)/ 不可行(全自主长程) browser-use/Playwright MCP 做只读与受控表单 围栏内写操作(sandbox+白名单+审计+回滚后) 乘法墙是 H∞ 级障碍:单步可靠 90% × 15 步 = 20.6% 完成率;OSWorld 2.0 上 Claude Opus 4.8 二元完成率 20.6%(部分分 54.8%)、GPT-5.5 ≈13%(arXiv 2606.29537【一手,验证 2026-09-21】,108 长程工作流/人类中位 1.6h/任务);工具描述层 97.1% 存在缺陷(arXiv 2602.14878【一手,X16 补编号后结案】);官方 SDK 同源缺陷 + 11 CVE + ~200K 暴露实例(OX Security 披露,量化经 verify B10 双源升级;Anthropic 回应原话为 "expected behavior"(经 OX 转述),消毒责任在开发者——"by design" 引语作废)
4 学习(持续改进) 20–40% 勉强 prompt 层 + 人工策划技能库 月度 GEPA 重优化 + promptfoo 回归门(fail-closed) 硬上限有三:① LLM 自生成技能 +0.0pp(SkillsBench, arXiv 2602.12670一手,相对人工策划 +16.2pp);② 个人化纯 PEFT 学知识 ≈ 白训(+1.07%,CIIR LaMP 37k 适配器研究, arXiv 2409.09510一手;+RAG 组合才 +15.98%);③ 递归自训练必然塌缩(Nature 2024 / ICLR 2025 replace 范式【一手文献链】)。可行收益被限定在:格式/行为/领域判别固化 + 核心 prompt 月度再优化(GEPA, ICLR 2026 Oral一手
5 创造(新信息/新工件) 25–45% 勉强 AlphaEvolve 式开源子程序进化器跑起来 + 域数据灌注(RAG)后做半结构化知识整理 "推理层以增量方式造出新信息"目前证据 ≈ 0(SkillsBench 自生成 0;"More Convincing, Not More Correct":judge pass 0.72→0.94 而 accuracy 恒 0.20,arXiv 2607.05904一手)——看起来更有说服力 ≠ 更正确;AI 产研究的真结果存在但噪音大(C 域 §5 判定),个人档只能做"进化子程序/整理证据"级别的创造
6 社交/协作(多智能体) 40–60% 可行(读并行+审环)/ 不可行(自由 swarm) 双代理评审环(读并行、写单线程) fan-out 读并行 + 单线程写 + 评审环 + 可观测性 分工裁决(冲突 2/10):广度读密集任务多智能体收益为真——但唯一硬数字是 Anthropic 自报内评(+90.2% 研究类任务、15× token、官方原文自己承认编码任务不可泛化一手);MAST 1,642 条轨迹 14 失败模式,Agent 间协调是最大失败类之一(arXiv 2503.13657一手+ 数据集 mcemri/MAST-Data 实存【一手,verify B12】);写并行被 Cognition 与 MAST 双重实证否定
7 自主性(24/7) 30–50% 可行(围栏内定时)/ 不可行(发现任务) cron + 心跳常驻,新手实测 cron 19/19 次成功【实测,2026-09-21】 渐进三级只读→受控→围栏内自动(近 60 天审批 >95% 才升级) 两条硬约束:① "agent 自己发现任务"的所有成熟实现里,规则全部是人写的(G/E/H 跨报告一致,无反例);② 长程全自主撞乘法墙 + H"长程不可靠"第一反方未被推翻。心跳成本 ~$0.015/天【单源,维持降权】;升级过快被红队 E5 击中(写操作人审无豁免条款)
8 自我认知(评测/监控) 55–75% 可行 promptfoo + 30 题金标准集(<$10/月)【测试通过,2026-09-21】 月度仪表盘四件套 + 季度 judge 校准 + 第三方盲评 5 对 LLM-as-judge 五重陷阱:judge pass ≠ accuracy(0.94 vs 0.20 实证一手);红队判 I1/C4 为"全文最硬一枪"——阈值曾经 ±2pp 低于 30 题套件的单题粒度 3.3pp,仪表盘失去刻度,修复后口径 = 阈值 ≥2 题(≥6.7pp)+ 连续 2 期同向;dashboard.py 仍是"写了没跑"(verify B5 未验证)

2.3 综合画像与"最强形态"边界

  • 总体上,个人条件下的能力上限最容易被"评测信号分辨率"与"单步可靠率的乘法结构"两个量封顶——这两条都是 H∞ 级原理,不会因模型或工具热潮而改变。
  • 8 个维度中,2(记忆)、8(评测)两个维度上个人可以做到"接近专业人士水准"(可行性证据最固化);7(自主性)、4(学习)是两个"看起来最诱人、实际最破"的维度,投入产出比最低,放在路线图最后并默认跳过权重级部分。
  • 综合画像为"人在闭环里的监督式增强系统":个人不可复制的是 model 的 generality,个人可复叠在系统上的是 memory 的 persistence、executable 的 reliability(在围栏内)、evaluable 的 honesty。

3. 三条贯穿性架构原则(H∞,原则级,六个月半衰期起步)

原则 1:钱先花在评估侧(C §6.2 判定)

每个改进闭环的上限 = 评估信号能分辨的最小质量差。验证器分辨率是天花板,不是算力、不是模型。落地为三件套(I 域 + 修复项): - 金标准任务集:30 题,其中 ≥30% 来自真实失败案例(不是理想场景); - 判读阈值:≥2 题(≥6.7pp) + 连续 2 期同向才算信号(30 题单题粒度 3.3pp,数学上不可突破); - 锚点陷阱:藏 5 题"绝对不该通过"的题,通过率 >0 = 题目已泄漏,整套任务集作废重建(redteam 1.3-b/1.3-a 补进)。

原则 2:防御在模型外(E §7.0 不变式)

prompt injection 在模型层无解(OpenAI 原话 "may never be fully solved"),MCP 生态实务佐证:30k server 中 62% 零维护、官方 SDK 同源缺陷 + 11 CVE、~200K 暴露实例(verify B10 量化,双源)。安全必须做在 harness/runtime/网络层,顺序固定: 沙箱 → 权限白名单 → HITL 人审 → 审计日志(JSONL 可重放)→ git 回滚。不可逆操作(付款 / 删库 / 对外发布)永不自动,无豁免条款。

原则 3:成本反脆弱(H3/12个月)

分层模型路由(70% 任务走便宜模型)+ 订阅月付 + 闲时批处理 + 缓存命中 + 至少 2 家可用 key每季度演练切换。限定语(redteam H3 赢一半,必须带上):这套组合令"钱"的支出结构稳定,不令"能力上限"稳定——补贴退坡时成本几乎不动,但可用的智能上限会随省下的钱一起下降。

国内现价锚点(全部一手,2026-09-21 官方页实拉,详见 APPENDIX-cost):DeepSeek V4-Flash 缓存命中闲时 $0.003/M(官方直连);硅基流动 GLM-5.2 8/28 元/M;GLM-5.3 现价 6/28 元/M(模型中心快照,未涨价);智谱 GLM Coding V1 老用户 49/149/469 元续费(V2 新价 118/538/1078,涨价潮之下 V1 续费是当前全市场最优单笔订阅);火山方舟 Coding Plan 限时 9.9 元起。


4. 做得到 / 做不到边界

4.1 做得到(每条附证据锚与验证等级)

能力 需要的条件 证据锚 等级
监督式工具栈(CLI agent + AGENTS.md + 沙箱) 订阅或免费 API、一台普通机器 Round 1 B/E/G 三域方案 + novice_test 环境链路 方案已设计【案头】+ 环境层【实测】
私有回归评测套件 promptfoo + 30 题 novice_test 测试 3 跑通(provider 语法已修)【实测】;round2 redteam 1.3-d:目标降级为"回归检测"后攻击未破 【实测工具层】
跨会话个人记忆 Obsidian + 本地向量库 + MCP 化记忆 能力建立的判决依据(跨会话状态无可替代)为 H∞ 原则,A 域阶段 0-3 免费 【案头 + 原则级】
浏览器受控执行(≤15 步、明确验收) browser-use / Playwright MCP 单步短任务 80-97% 可靠(E 域,自报口径,judge 不可比)【单源/自报】 【单源降权】
域专精/个人知识注入 个人资料 + RAG(不是微调) +15.98%(RAG+PEFT 组合)vs 纯 PEFT +1.07%(CIIR, arXiv 2409.09510一手 一手
技能层 prompt 工程 人工策划技能库(非自生成) +16.2pp(SkillsBench一手 一手
核心 prompt 的季度级再优化 GEPA 开源器 超_GRPO 平均 +6%、最高 +20%、rollouts 省 35×(ICLR 2026 Oral一手 一手
围栏内 24/7 定时任务 cron/心跳 + 断路器 + 审计 novice_test cron 19/19、全套基础设施组件活跃【实测 + 一手】 【实测 + 一手】
月账单可控(国内) 零元-轻档 0-50 元、订阅档 40-200 元 cost_route §3 全表现场校验【一手,2026-09-21】 【一手价格,H0-H1 半衰期】

4.2 做不到(反对侧硬边界,实证击穿后仍然站立)

# 边界 击穿证据(含等级)
1 从零训练基座模型 算力鸿沟 8-9 个数量级(DeepSeek V3 训练 $5.576M【一手技术报告】);LeCun"LLM 之外还有数量级鸿沟"论点未被任何新证据推翻
2 全自主长程 agent(无人兜底) 乘法墙(数学硬结构);OSWorld 2.0 最佳 20.6%一手;"agent 发现任务"零成熟实现【跨报告一致】;断/卷人审(HITL)被三域红线一致要求不可豁免
3 权重级自我提升飞轮 replace 范式必然塌缩(Nature 2024 / ICLR 2025【一手文献】);个人数据反哺 ≈ 复刻教师知识,无法超越;LoRA 学"形式"不学"事实"(F 域自我承认,与 H 域裁决一致)
4 个人化 PEFT 学知识 / 注入新事实 +1.07% 接近零(CIIR一手);"低且不稳"(F 反向确定);对少数确定有收益的场景(格式固化 / 隐私推理)才值得投入
5 评测集"防污染" 命题降级为"私有回归检测"(redteam 1.3-d:回归告警成立、防污染 overclaim)——题集走 API 即在供应商训练管道内,opt-out 与锚点陷阱是仅有的低成本防线
6 对免费层的长期依赖 免费层退坡是实证而非预测:Gemini CLI 免费层 2026-06-18 断供、OpenAI 免费层广告化+限额收紧【双源】;"0 元装"只能当教学装
7 封号后靠工单恢复 Anthropic 申诉翻案率 3.3%(2025 H2)→ 10.6%(2026 H1:11.4M 封禁 / 398k 申诉 / 42k 翻案,官方 Transparency Hub【一手,X5 已更新】);备份 key 的连坐风险要求"活体验证"(不同网络/邮箱/支付通道,每月真实调用一次,未验证的不算备份)
8 "验收=自动执行"的信仰 装了验收不等于会去验收(redteam E4/A1 + critic #4);任何把"每周导出/月度审计"写进承诺但人不会去点按钮的机制,实际保护为零(J5:对话史无导出 API,cron 化承诺在核心对象上不存在)
9 按公开榜单选模型 SWE-bench Verified 已被 OpenAI 官方弃用(2026-02-23 公告,59.4% 缺陷一手);Pro 分数只有 Scale 标准化板内可比,同一基准三榜三个第一名;唯一正确用法 = 自建任务集 + 官方系统卡抽查(冲突 6 裁决,I 域)

4.3 国内 / 海外读者分支声明(critic #6 落实,全部 final 文档共用)

本文核心架构证据(METR 时间地平线、OSWorld、MAST、CIIR/LaMP、τ-bench pass^k、SkillsBench)全部来自英文世界与海外厂商的公开研究——这是语料的结构性现状,不是选偏。它带来的命题级风险:如果国内 API 的可靠性、合规环境(内容审核对 agent 工作流的截断、备案边界)与海外显著不同,本文结论对目标读者(中国大陆个人用户)不可整机迁移。处理方式(诚实分级):

  • 已做一手校验的(可放心引用,但注意各自半衰期):国内直连层(DeepSeek api.deepseek.com / Qwen dashscope / Kimi api.moonshot.cn / GLM open.bigmodel.cn / 豆包,全部无需代理【单源_tech社区 + 官方域名事实双重印证】)、订阅与 API 价格(cost_route 全表,官方页当日实拉一手)、盈亏平衡点(个人达不到,结论维持【双源+精算】)。
  • 只有方向性判断的(按低置信处理):生成式 AI 管理办法的执法边界、中转站长期稳定性、内容审核对自动化工作流的具体截断率。这三项没有同级定量研究,国内读者在自证实验的 10 个任务里自然会碰到——碰到什么记什么,这比本文任何推断都准。
  • 海外/可直连海外读者分支:OpenAI/Claude 官方 API + 海外订阅正常可用;但封号风险数据(4.2-#7)需要计入,且所有"个人 token 账单结构"结论必须按"Agent SDK 计费拆分已暂停未生效"的现行状态计算(verify B2:官方帮助中心原文 "For now, nothing has changed"【双源,2026-09-21】;重启时间未定,官方承诺提前公告——若重启,SDK 重度用户成本将从订阅池跳到按牌价计的独立 credit)。

5. 证据品质账本(审计降权过滤的结账)

5.1 X1-X16 降权过滤器结账表

每个曾被打上降权标记的数字,进入本文档前必须在此表中被"处置"——没有出现在此表的任何 Round 1 数字不进入 MASTER 判定层

# 处置结果 结案依据
X1 Continue 仓库"已归档" 更正撤销:实测 archived=False、2026-09-20 仍 push audit GitHub 直查
X2 claude-code ★~14k 更正:146,990★(差 10 倍,不影响"活跃"结论) audit GitHub 直查
X3 GLM-5.2 SWE-bench Pro 分数两说 结案:62.1% 为唯一可信数字(官方 model card + z.ai 博客 + 三方独立源全部 62.1%,零源支持 68.5%);"开源第一"仅指 SWE-bench Pro 开源权重第一,整体次于 Opus 4.8(69.2) verify B1一手
X4 "6-15 SDK 计费分离已生效" 更正:宣布后已暂停("For now, nothing has changed"),现行仍是订阅统一计量;重启时间未定 verify B2【双源】
X5 Anthropic 封号数据过时 更新:2026 H1 = 11.4M 封禁 / 398k 申诉 / 42k 翻案(10.6%) audit 官方 Transparency Hub一手
X6 Paperclip 53k★/6周 更正:81,124★(2026-09-20 GitHub 实测) audit GitHub 直查
X7 内容农场互抄被标 both 系统性降权:凡仅由 C 层(内容农场)支撑的 both 标签一律按 single 处理;本文引用的核心数字全部改绑一手/独立双源 audit §3.1
X8 Zep CE 弃更未核验 结案:官方 FAQ 原文证实弃更,产品仓转为示例/集成;自托管路线只剩 Graphiti 引擎 + 自备图数据库(Neo4j/FalkorDB/Kuzu) verify B4【一手+双源】
X9 claude-mem/MemPalace star 增长自然性 部分结案:星数/创建日/活跃度一手真实;增长自然性因无 token 不可核查,"本地文件派登顶/个人 agent 霸主"叙事降格为"星数高企且项目活跃属实,增长自然性未审计" verify B3【一手+低置信双标注】
X10 Hendrycks 27%/57% 单源 升级为一手:arXiv 2510.18212《A Definition of AGI》PDF 原句命中(27%=GPT-4、57%=GPT-5、"长时记忆是最大短板"为原文论断);"微软协议 AGI 8 次→0 次"仍维持降权 verify B9一手
X11 全部新代号第三方聚合分数 原则维持:默认低置信;仅两个已对官方卡核实(GLM-5.2 Pro 62.1、Opus 4.8 Pro 69.2 + $5/$25 计价)可用;Fable 5 / Mythos / GPT-5.6 分数等其余仍禁入;GLM-5.2 价格三说不一待官方 pricing 页 verify B6【部分一手锚】
X12 57% 假数据 / $1040/篇 / 21% AI 评审 维持降权(二级转述) audit 维持
X13 40+ CVE / 24,008 泄露密钥 / 492 裸奔 server 维持降权(数字未复核,方向可信,只作风险量级参考,不作引用);"by design"引语作废,改为 "expected behavior"(经 OX 转述);OX 披露的量化(4 SDK 缺陷 / 11 CVE / 7000+ 暴露 / 150M+ 下载 / ~200K 实例 / 6 平台实证被攻破)经 B10 双源升级可整体引用 verify B10【部分结案】
X14 Bankrbot $150K / METR $600K 金额 部分结案:Bankrbot 事件链双源坐实,金额改区间 "$150K–175K(口径不一,链上可查)",注 SlowMist 原帖未直读;"METR $600K credits" 从本文档剔除(未核实) verify B7【部分】
X15 M5 Ultra / Spark / RTX60 路线图 维持降权(媒体转述无官方规格页);叠加 2026 涨价周期(内存年涨 3 倍、SSD +56%、缺货至 2027H2),"等 60 系"策略已死;5 万预算正确姿势 = 4 万存理财 + 按需云租(4090 1.3-2.5 元/h)+ 1 万内年度订阅 cost_route 现场【一手行情】
X16 "856 工具 97.1% 缺陷"缺编号 结案:实为 arXiv 2602.14878(103 server × 856 tools),补编号后升级【一手可查】 verify B8 同批次

5.2 十组冲突裁决的影响落点(Round 2 conflict_adjudication → MASTER 条款)

# 冲突 裁决 在本文的落点
1 本地 vs 云成本 双方都对但平衡点口径不同(D 2-5M tok/天=裸算力;J 110亿 tok/月=含人力全成本),个人用量全部落在 API 赢区 §3.3 / §4.2:成本反脆弱条款;本地只买隐私/离线/微调
2 多 vs 单智能体 任务分族:广度读密集=真收益(+90.2% 自报);写密集=否 §2 维度 6 区间上限的构成依据
3 记忆层 vs 长上下文 分层成立但按语料规模分档:<100K 直塞 / 100K-500K 新模型直塞可选 / 跨会话必为记忆层 / >500K 或交互场景 → RAG §2 维度 2 下限锚调整 + APPENDIX 路线
4 微调效果 三分法:SFT 格式/分类真 / 个人化 PEFT 近零 / 递归自训塌缩 §4.2-#3/#4 边界条款
5 本地 vs 前沿差距 三层结构维持;修正:K2.5 BrowseComp 78.4% 必须标 Agent Swarm 模式(标准模式 60.6%)【一手 + 口径补注】 不进本文承重数字,仅 D 域引用
6 SWE-bench 可比性 Verified 弃用 + Pro 三口径分裂;公开分数不可用于选模型 §4.2-#9 边界条款
7 METR 翻倍口径绑定 全期 196 天 ≈ 6.5 月;≥2024 口径 88.6 天 ≈ 3 月(官方 TH1.1);≥2023=130.8 天;16h 以上测量不可靠(官方原话) 用法统一:"METR 50% 地平线全期约 7 个月翻倍,2024 年以来加速至约 3 个月(88.6 天,官方 TH1.1 口径),16h 以上不可靠"
8 OpenAI 订阅 $20 vs $24 无法闭环,维持中置信,写"$20-24(来源冲突,官方页为准)" 不进承重数字;APPENDIX-cost 标注
9 GPT-5.6 Luna 输出价 D vs J J 对(官方文档 $1.20/M),D 错 价格表锚定规则:一切价格以厂商官方 API 文档为最终锚点,聚合站只当线索
10 Anthropic +90.2% 边界 数字真,域限定(自报内评 + Anthropic 原文自认编码不适用) §2 维度 6 全部条款带"自报"限定

5.3 承重数字三元组速查(本文档引用的全部一手/双源数字)

数字 来源类型 口径 验证日期 半衰期
GPT-5 心理测量 AGI 57%(GPT-4 27%) 一手(arXiv 2510.18212 PDF 原句) Hendrycks 33 人框架 2026-09-21 H3(12-24 月)
GLM-5.2 SWE-bench Pro 62.1% 一手(HF model card + z.ai 博客) 官方卡现行表 2026-09-21 H1(基准分 1-3 月)
Opus 4.8 Pro 69.2% / $5·$25 计价 一手(官方卡 + 5 源计价页) 官方口径 2026-09-21 H1 价格 / H2 分数
OSWorld 2.0:Opus 4.8 二元 20.6%(部分 54.8%) 一手(arXiv 2606.29537) 二元完成率 2026-09-21 H2
CIIR:PEFT +1.07% / RAG +14.92% / 组合 +15.98% 一手(arXiv 2409.09510 摘要逐字) LaMP 37k 适配器 2026-09-21 H3
SkillsBench:人工策划 +16.2pp / 自生成 +0.0pp 一手(arXiv 2602.12670) 平均,16 任务 2026-09-21 H3
GEPA:+6% 平均 / 最高 20% / 省 35× 一手(arXiv 2507.19457, ICLR 2026 Oral) 对 GRPO/MIPROv2 2026-09-21 H3
Anthropic +90.2% / 15× token 一手(官方工程博客逐字) 自报内评,研究类任务 2026-09-21 H2
MAST:1,642 轨迹 / 14 失败模式 一手(arXiv 2503.13657 + mcemri/MAST-Data) 7 框架 / 8 基准 / 5 LLM 2026-09-21 H3
METR 88.6 天(≥2024)/ 196 天全期 一手(metr.org 官方 TH1.1 表) 50% 地平线 2026-09-21 H2(新官方数据出现即替换)
τ-bench pass^8 ≈ 25%(from ~61% pass^1) 一手(arXiv 2406.12045) retail 2026-09-21 H3
METR RCT:AI 使完成时间 +19%(自感知 +20%) 一手(arXiv 2507.09089) RCT 开发者 2026-09-21 H3
MCP:62% server 零维护 / 11 CVE / ~200K 实例 双源(OX 披露链) 2026-09 快照 2026-09-21 H2
Anthropic 2026 H1 封禁 11.4M / 翻案 10.6% 一手(官方 Transparency Hub) 半年报 2026-09-21 H2(2027-01 更新)
Agent SDK 计费拆分 = 已暂停 双源(帮助中心 15036540 原文 + 17 独立源) 现行政策 2026-09-21 H0(随时重启)
Zep CE 弃更 / 自托管仅剩 Graphiti 一手+双源(官方 FAQ 原文) 产品线现状 2026-09-21 H2
DeepSeek Flash 缓存闲时 $0.003/M 一手(官方 pricing 页当日) 官方直连 2026-09-21 H0-H1(1 月内重查)
硅基流动 GLM-5.2 8/28 元/M;GLM-5.3 6/28 元/M(模型中心快照,未涨价) 一手(官方 pricing 页 + 模型中心当日实拉) 现价 2026-09-21 H1
智谱 V1 老用户 49/149/469 续费 双源(网易科技 + codingplan.org) V2 涨价后 V1 存量价 2026-09-21 H0(套餐到期前有效)
火山方舟 Coding Plan 限时 9.9 起 一手(官方活动页) 名额制限时 2026-09-21 H0(随时结束)
盈亏平衡:二手 3090 需 9,200 万 tok/月 双源+本机精算 电价 0.55 元/kWh、4 年折旧、8h 满载 2026-09-21 H3(参数变才重算)
Free-tier 退坡实证(Gemini CLI 断供等) 双源(多事件) 2026-06 窗口 2026-09-21 H2(方向级)
novice_test:6 测试 / 11 卡点 / cron 19/19 实测(本机 Kali VM) CPU-only 环境 2026-09-21 工具版本 H2

5.4 明确"未验证 / 不入账"清单(入档但禁用)

状态 处置
dashboard.py(I 域仪表盘脚本) 未运行验证(环境红线禁装依赖) 不是"可用工具";使用前必须在装有 promptfoo 的环境先跑通并人工核对输出 schema
METR "$600K credits" 案例 未核实(10 源未命中当事人原帖) 从本文档剔除
智谱 V2 积分制下 "120M/600M tokens" 口径 不可精算(积分制 + 90.9% 缓存理想前提,实际可差 2 倍) 只作量级参考
火山方舟 Lite 常规月费 40 元 单源(官方页 JS 动态未取到) 待复核;下单当天以结算页为准
Kimi K3 API 现价 20/100 元 未复核(SF 现价页已无 K3) 重查后才可引用
OpenAI Plus 订阅 $20 vs $24 来源冲突未闭环 写区间,官方页为准
备份 key / 沙箱 / 断路器在"真实用户手中"的实际执行率 无数据(全项目 0 用户研究) 自证实验补这一行

6. 如何验证自己在进步(最小可行纪律集)

6.1 最小纪律集(≤2 项/月,critic #3 的直接落实)

一个要求每月 6-10 项仪式性维护的个人系统,按本项目自己的 A1 判定("验收过苛把系统失败伪装成人的失败"),第一弃坑窗口 = 第 2-4 周——恰好是纪律最密的阶段 0-1。因此默认纪律收缩到两条,所有"进阶项"单独可选、默认不做:

  1. 月度重跑 30 题(10-20 分钟):跑同一个金标准集,看分数是否跨过 ≥2 题阈值。
  2. 账单异常率抽查(<5 分钟被动触发):环比异常 >50% 才去查官方价格页——日常不主动盯价格(freshness §6.2 同结论:被动的账单异常 + 5 分钟脚本已够用)。

其余的"月度审计、封号演练、盲评、judge 校准、灾备演练、任务集轮换……"全部降级为可选进阶(CHECKLIST 单列,做不做不判定系统成败)。这就是 critic #3 的算术:固定监控成本是小系统最大的隐性税,把它压到"一个人真的会做"的量。

6.2 判读规则(红队 I1/C4 修复后的口径)

  • 阈值 ≥2 题(≥6.7pp)——30 题套件单题粒度 3.3pp,±2pp 的"持平"区间在数学上不存在,曾使仪表盘"失去刻度";
  • 连续 2 期同向才算信号,单月波动不作数;
  • 趋势线只看 3 个月(I 域 §7.5 原则,保留);
  • 盲评胜率判读(样本 20 对):≥60% 进步 / ≤40% 退步 / 中间 = 噪声;每月抽 5 对给"没参与项目的人"盲选(第三方对冲自己的风格记忆);
  • "连续上涨"也要怀疑:新题(≥20% 季度轮换,且 ≥30% 来自真实失败)与老题分列统计,两列差 >15pp = 老题过拟合,不是系统变好(redteam 1.3-b);
  • 自家分数连续 2 期跌破基线时的处置顺序:先查模型静默升级(厂商公告/官方 deprecation 页),再怀疑任务集过拟合,最后才怀疑工具链(freshness T7 顺序);
  • 用真实生产失败替换 10% 评测集,不让任务集停在理想场景。

6.3 进步的"非仪表盘"检验(给不装仪表盘的读者)

如果连最小纪律集都嫌重,只回答一个问题(季度一次,10 分钟):"这个月有没有一件事,是 12 个月前我不会、现在因为系统而在行的?" 答不上来超过 2 个季度 = 这套系统对你没有产生 generality 增益,应当缩减到常用 3 个任务,而不是反过来加码运维。

6.4 首月第一项(critic #8 落实)

使用本文档的第一个动作不是安装任何东西,而是:对照 APPENDIX-facts.md §F 账本,把本文档全部价格/模型/政策类结论(§3.3、§5.3 中标记 H0/H1 的行)在引用当天重查一遍——本文档的半衰期从交付日 2026-09-21 起算,价格类最多 1 个月、政策类(Agent SDK 计费)随时重启。重查命令与监控清单在 APPENDIX-facts §4(成本 <5 分钟)。


7. 三号批评家 8 击的落点自查(本文档哪里吸收了哪击)

# critic 攻击 类型 本文落点
1 8 维可达度无方法论 §2.1:单值 → 区间 + 三档定性 + 锚点等级标注 + 构成程序声明;百分比降为"横维参考,非测量值"
2 支持侧零第一手证据 §0 推论 3 + §1.1:支持侧整栏降级为"待自证假设";ROUTE.md 第 0 周内嵌自证实验(10 真实任务 + 计时对照),Nature of claim 由"支持"变"假设成立则自证"
3 纪律负担 → 弃坑交叉点 结构 §6.1:最小纪律集收缩为 ≤2 项/月;其余全部"可选进阶";CHECKLIST 不再把全量运维列为默认
4 "验收文化"自我庆功 §0 推论 2 + §1.2:措辞统一为"验收在设计中已建立,在执行中未验证";Round 2 判分口径的双标不再被引用为方法论遗产
5 预算建立在补贴价上 硬伤 §0 时态纪律 + §6.4:所有价格标"截至 2026-09-21"+ 首月第一项=重查;APPENDIX-cost 需给出补贴延续/退坡 2×/退坡 5× 三档价格情景(转交该附录)
6 中国读者证据错位 结构 §4.3:整机级国内/海外分支声明;已校验/方向性/低置信三级划分;合规截断率明示"无同级定量研究,按低置信"
7 收敛轮放大未验证内容 §0:验证等级声明三档化(案头推理 / 单机实证 / 独立复现),novice_test 定权重最高,本文档整体标注案头档
8 交付滞后吃掉半衰期 硬伤 §0 时态纪律 + §6.4:全文"现行"改"截至 2026-09-21";CHECKLIST 首月第一项=重核价格/模型/政策结论(不是信任本文)

8. 自我锐评(本文档自身的盲点,保留到下轮)

  1. 本文档也是案头推理档:上述全部"修正"来自纸面交叉,没有任何一条在真实用户上运行过。验证等级声明(§0)对本文同样适用——它把这个问题从"没做"升格为"刻意设计进第一步(自证实验)",但实验的执行责任仍在读者。
  2. 区间仍是无方法论的估计:8 维区间比单值诚实,但没有脱离"架构师主观插值"的性质; stringent reading 下它只是把不确定性显式化了,不是消除了。若未来出现 3-5 名国内个人用户的真实追踪样本,应该替换本文档的整个 §2。
  3. 汇率的单日快照:全文用 $1≈¥6.75(网易 2026-09 口径);round2 的 7.2 已过时。人民币破 7.5 时触发式重查(freshness T 序列)。
  4. 账本的覆盖度有限:Round 1 约 200+ 数字级断言,只有互相冲突的 10 组 + X1-X16 + B1-B12 (12项核实) 进入结账;单报告内部自洽的数字未逐一回溯(audit 明示的范围外事项)。信任本文的读者应当把"抽查 3 个你不认识的数字"当作阅读习惯而不是例外。
  5. 时基都不再是"现状":你读到本文的时间 > 2026-10-21 时,本文所有 API 价格与政策快照按半衰期规则已过期一档以上;此时请以 APPENDIX-facts 账本 + 官方页为准,不要以本文为准。

MASTER.md v1.0 | 2026-09-21 | 输入:round2/master_skeleton + verify.md(B1-B12) + conflict_adjudication(10组) + redteam_optimism§4(十条修正) + audit_methodology§4(X1-X16) + cost_route(修正硬件价) + freshness + critic(8击) + novice_test(唯一实测档) | 判定规则:审计降权过滤未结案者不入账 | 下一次全文半衰期复核日:2026-10-21