AGI 路线调研终稿 · 2026-09-21 快照
CHECKLIST

CHECKLIST

90 天打卡清单(月度必做仅 2 项)

CHECKLIST.md — 90 天打卡 + 月度纪律清单(个人用户逼近 AGI 路线配套)

配套文档:ROUTE.md(阶段 0-5 命令级步骤)、MASTER.md(结论判定)、APPENDIX-cost.md(价格)、APPENDIX-facts.md(事实账本)。 时间基准:2026-09-21。 本文所有价格、模型名、政策状态均为截至 2026-09-21 的快照,不是"现行"承诺——所以第 30 天打卡的第一件事就是重核它们(见 §4)。 验证等级声明:本项目整体处于案头推理档(唯一实测档证据是 novice_test 的 6 条实测 + 11 个卡点,其修正命令在本文中权重最高、直接内联)。你照做时跑出的结果,就是你自己的实测档证据。 读者与地域声明:面向中国大陆个人用户。本文数字基于国内生态(GLM / DeepSeek / 硅基流动 / 火山方舟等)为主,海外分支(Gemini/OpenRouter/Claude)仅作参考——海外价格与政策对大陆读者不可直接迁移。 信心纪律:所有带数字的结论标注验证日期与半衰期(H0≤2 周 / H1 1-2 月 / H2 3-6 月 / H3 6-24 月)。查不到的写"未核实",本文不编造。


0. 使用方法(30 秒读完)

  1. 这份清单是打卡表:每个节点勾选 [ ][x],写日期。别跳步,也别加戏。
  2. 每月固定纪律只有 2 项(§5)。清单里其余所有"建议做"的条目全部标了 可选进阶——不做不影响验收,做了更好。刻意少做是这份清单最重要的设计:每月 6-10 项仪式性维护是弃坑的第一诱因(Round 3 critic §3 裁决),所以这里只保留 2 项。
  3. 卡住了:先查 §7 卡点速查表(11 个实测坑),再查对应 ROUTE.md 阶段的"卡住怎么办"。
  4. 中断了:直接从最近一个未勾节点继续,不要从头重来。弃坑两周以内回来都算连续。

1. 第 0 周:自证实验(开工前必做,0 元,约 2-3 小时)

为什么要先做这个:五轮调研里"个人用户用 AI 真的变强了"的第一手正面案例 = 0(critic §2)。所以在投入 90 天之前,先给自己跑出一个样本量 1 的正/反证据。这个实验结果决定你要不要认真走后面 90 天。

做法:挑 10 个你上周真实遇到的任务(写邮件、整理文件、查资料、写小脚本、做总结……),每个任务做两次对照:

# 任务 纯手动耗时 用 AI 耗时 AI 产出质量(1-5) 你满意吗(Y/N)
1
2
10

工具:阶段 0 还没搭,就用免费的网页端旗舰(Kimi / 豆包 / DeepSeek 网页版 / 腾讯元宝,全部无门槛,截至 2026-09-21 可用〔一手〕)。不用搭任何环境。

打卡项: - [ ] 10 个真实任务对照表填完 - [ ] 算两个数:平均省时比例满意率(满意任务数 ÷ 10) - [ ] 写一句结论贴在打卡表旁边: - 省时 ≥30% 且满意 ≥6/10 → 继续走 90 天,记下你满意的任务类型(这就是你后面的金标准题库原料) - 省时 <10% 或满意 ≤3/10 → 诚实停下,把不满意的具体原因写下来(提示词问题?任务类型问题?)——换个任务类型重跑一轮,仍不行就放弃这条路,这本身就是有价值的结论 - 中间 = 灰区:别急着开阶段 1,先换任务类型或优化提示词后重跑一轮再定——这一条与 ROUTE §0.0 自证判据统一(2026-09-21 walk-through R6 修复)

注意:这一步是"样本量 1 的自证",不是科学实验。它的作用是防止你花 90 天去验证一个对你个人根本不成立的命题。


2. 第 1 周:环境起步打卡(预算 0 元起步;可选的 DeepSeek 充值 ¥10 起步属跑 eval 自选,不花也能走完第 1 周;订阅类支出(如火山方舟 ¥9.9)属阶段 1)

2.1 免费栈搭建(大陆主干,0 元)

  • [ ] 硅基流动注册:送 ¥14 + 13 款以上永久免费模型(Qwen3-8B 等)〔截至 2026-09-21 有效,H0-H1 级,下单/注册当天重查官网 pricing 页〕
  • [ ] DeepSeek 开放平台注册:新账号 500 万 tokens / 30 天〔截至 2026-09-21,H0-H1
  • [ ] 火山方舟新用户:300 万 tokens;Coding Plan 限时 9.9 元起(多模型切换 + 工具不限)〔一手,volcengine.com/activity/codingplan 2026-09-21 实拉;H0〕——可选,阶段 1 才需要,第 1 周不花(walk-through S12)
  • [ ] 记住账单心法:轻档用户(每天几十次问答)月账单 <¥50,不存在成本问题

有境外网络/支付的分栏(可选):Gemini Flash 免费档、OpenRouter 免费层、Groq。大陆网络直连不可用,不要把它当主干

2.2 本地环境(可选,无 GPU 机器也能走)

  • [ ] Ollama 安装:curl -fsSL https://ollama.com/install.sh | sh,装完必跑 ollama --version 对照 GitHub releases(固定版本会装旧版,novice_test 卡点 8)
  • [ ] 小内存(8G)机器:先 ollama pull qwen2.5:0.5b 走通流程即可;≥16G 内存再上 7B;0.5B 质量很差,只当流程验证(novice_test 实测)
  • [ ] 想不常驻:systemctl disable --now ollamaOLLAMA_NO_START=1 在 Linux 无效,卡点 7)

2.3 评测地基(阶段 0 验收核心)

  • [ ] npm i -g promptfoo(约 2.5 分钟,体积 2.6G,小磁盘先 df -h 确认)
  • [ ] 用 ROUTE.md 内联的修正版 yaml 跑通第一次 eval——provider 语法是 ollama:chat:<model>,冒号不是点号ollama.chat:x 必报错,novice_test 卡点 1,已实测)
  • [ ] 把第 0 周自证实验里你满意的任务类型,写成 30 道金标准题(其中 ≥30% 来自真实失败场景,不是理想场景)
  • [ ] promptfoo eval 跑出第一份基线快照,把通过率数字记在打卡表旁边

2.4 记忆系统起步(0 元)

  • [ ] 建 vault:mkdir -p ~/memory-vault/{00-inbox,10-projects,20-areas,90-archive}
  • [ ] 母本笔记 + 收集箱开始用(每天往 00-inbox 丢东西即可)
  • [ ] 无 GUI 服务器:跳过 Obsidian 插件,语义检索延后到阶段 1 用脚本实现(sqlite-vec + bge-m3,ROUTE §0.6 原文)——第 1 周不做,不要为此卡住
  • [ ] 只读观察期从今天起算——30 天只读零事故的"30 天"从第 0 周第 1 天计,不是从阶段 1 开始计(时间轴修复,route_attack R1-1)

第 1 周验收:promptfoo 基线快照有数字;vault 能检索命中 3 条历史笔记(有桌面端时,无桌面端此项延后到阶段 1);能说出"我这周 30 题通过率是多少"。


3. 第 30 天打卡:第一次月度盘点(约 35-60 分钟)

  • [ ] 【首月第一项,必做】重核价格/模型/政策:本文和 APPENDIX-cost 里的所有价格、免费额度、模型版本、订阅政策都是 2026-09-21 快照,价格类事实 1-2 个月就能翻转(实证前科:智谱 2026-07 整体涨 30%、GLM Coding Plan V1→V2 涨价 141%+、Anthropic 计费分离宣布后暂停)。核对方法:
  • 官方页人工过一遍(10 分钟):siliconflow.cn/pricingapi-docs.deepseek.com/quick_start/pricingbigmodel.cnvolcengine.com/activity/codingplan
  • 聚合站只当线索不当结论(前科:聚合站输出价写错、官方文档才对)
  • 变了的 → 更新 APPENDIX-cost,并在 final/CHANGELOG.md 记一行:日期 | 变了什么 | 影响哪份文件 | 已更新✅(CHANGELOG.md 为 walk-through 验收整改后新增账本,2026-09-21 起生效)
  • [ ] 重跑 30 题金标准:promptfoo eval,对比基线快照
  • [ ] 读数纪律(H∞ 数学,不需重查):30 题集单题翻转 = 3.3pp,±2pp 以内的波动全是噪声。进步 = ≥2 题(≥6.7pp)翻转且连续 2 期同向;单月波动不算数(route_attack R2-1 修复)
  • [ ] 只读事故盘点:自第 0 周起算满 30 天了吗?有事故吗?(无事故 → 阶段 1 写操作解锁的前置条件达成)
  • [ ] 记忆系统在用吗?vault 里这月新增 ≥20 条笔记吗?(没在用 → 诚实记录,别假装)

第 30 天验收:完成首月价格重核 + 有第二份快照 + 知道系统是变好、变坏还是噪声。


4. 每月 1 日:最小纪律集(全清单只有这 2 项是每月必做

设计依据:critic §3 裁决——最小可行纪律集 = 月度重跑 + 一次手动抽查,≤2 项/月,其余全部可选进阶。总耗时约 30-40 分钟,超过 1 小时说明你做多了

纪律 ① 月度重跑金标准(约 30 分钟)

  • [ ] promptfoo eval 重跑 30 题,记录通过率
  • [ ] 按 §3 读数纪律判读(≥2 题且连续 2 期同向才算信号)
  • [ ] 连续 2 期跌破基线 → 先查是不是模型被厂商静默升级了(触发器 T1),再怀疑任务集过拟合——这个顺序不能反

纪律 ② 手动抽查:钱 + 免费额度 + 工具存活(约 5-10 分钟)

  • [ ] 看本月账单:环比异常(>50% 涨)→ 当天去官方 pricing 页查原因
  • [ ] 免费额度还在吗(硅基流动 ¥14 用完没、DeepSeek 500 万 tokens 过期没)——免费层随时可砍(前科:Gemini CLI 已断供),别依赖,只当白嫖
  • [ ] 核心工具一行脚本体检(可直接复制):
for r in ollama/ollama promptfoo/promptfoo HKUDS/LightRAG qdrant/qdrant browser-use/browser-use; do
  curl -s https://api.github.com/repos/$r | jq -r '"\(.full_name) \(.stargazers_count)★ pushed=\(.pushed_at) archived=\(.archived)"'
done

archived=true 或 pushed 停滞 >6 个月 → 从工具清单降级,找替代(前科:sst/opencode、ggerganov/llama.cpp 两起组织迁移就发生在定稿后一周内)

每月可选进阶(不做不影响任何验收,按需挑)

  • 可选进阶 月度盲评 20 对(底座 vs 底座+改进;45-60% 区间是噪声,连续 2 期同向才算信号)
  • 可选进阶 MCP server 白名单三条件核查(近 90 天 commit / issue 有响应 / vendor 背书)——只在阶段 1 用了 MCP 后才有意义
  • 可选进阶 记忆库遗忘审计 30 分钟(删过时笔记、合并重复)
  • 可选进阶 每周 5 题 probe 回归 + 跌破基线告警——阶段 4(24/7 自主)上线后才升级为必做(无回归门的 24/7 系统 = 没仪表盘的自动驾驶,route_attack R4-1 must-fix)
  • 可选进阶 输出价/峰谷时段重查(若用了 DeepSeek 闲时批量通道)

5. 第 90 天打卡:季度盘点(约 1-2 小时)

5.1 必做项

  • [ ] 每季灾备演练(必做,约 30 分钟):假设你的主力 API/订阅今晚消失,计时恢复 3 个核心任务(目标 <30 分钟)。具体:切换到备用厂商(免费栈里的第二家),把一个金标准任务跑通。记录实测耗时——之前文档写的"2 小时可切换"是修辞,你的实测数字才是结论
  • [ ] 90 天总账:把 3 个月的月度通过率连成趋势线,回答一个问题——"我的系统对我更有用了吗?"(盲评胜率 ≥60% = 进步、≤40% = 退步、中间 = 噪声;只看 3 个月趋势,单月 ±2pp 全是噪声)
  • [ ] 用这 90 天的真实失败案例替换 10% 的评测题(≥3 题)——防任务集过拟合的固定比例机制
  • [ ] 成本/$ 复盘:质量/$ 连续两月下降 → 换模型或精简支架

5.2 季度可选进阶(不做不影响验收)

  • 可选进阶 GitHub 健康度全量重跑(github_checks.json 里全部仓库,比对 star/pushed/archived)
  • 可选进阶 judge 校准 30 例,一致率 ≥85%,跌破改 judge prompt(I 域规则,脚本未实测,标"未验证")
  • 可选进阶 benchmark 分数对官方系统卡(聚合板数字全部加日期重验)
  • 可选进阶 监管快照:网信办官网 + 新规过一遍(7-15 拟人化新规、AI 标识办法,截至 2026-09 生效中)
  • 可选进阶 阶段 3 硬件评估:只在确实需要隐私/离线/微调时才看——买 GPU 的理由是隐私和离线,不是省钱(个人用量 95% 落在盈亏平衡点左侧);2026 硬件处于涨价周期顶部,5090D V2 已禁入境,20K 档甜点是双二手 3090(下单当天必须重查华强北行情,H0 级一日一价;走转转/京东拍拍验机,避开闲鱼低价假卡流水线)

5.3 90 天节点决策

  • [ ] 全部必做项打勾 + 趋势线向上 → 进入 ROUTE.md 阶段 4(24/7 自主),并把"每周 5 题 probe 回归"升级为必做
  • [ ] 趋势线平/向下 → 停在阶段 2-3,先做 §3 的归因(模型升级?任务过拟合?还是这系统对你本来就没用——回到第 0 周自证实验的结论对照)
  • [ ] 90 天里累计弃坑 >4 周 → 诚实降级为"轻量用法":只保留网页端 + 每月纪律 ①,这也是合法结局

6. 半年与事件触发(轻量提醒,不占月度纪律名额)

  • 半年一次(可与第 2/3 次季度盘点合并):重读反方报告逐条问"这条反对论据今天还成立吗";盈亏平衡用最新价格+你的真实用量重算
  • 事件触发即查(看到相关新闻才查,不用定期扫):
触发 动作
任一厂商发布新旗舰模型 你的金标准结论可能被静默升级影响 → 重跑一次 30 题
官方价格变动 >20% 重算月账单;检查"订阅 vs 按量"是否翻转
免费层/公测结束公告 24 小时内换免费池(前科:智谱 2026-08)
新监管新规生效 重走一遍合规红线(APPENDIX-security)
所用工具 major 更新/归档 GitHub API 确认后重测命令再更新
新 CVE 涉及 agent/MCP 工具链 评估是否影响你的白名单
代充/支付渠道风控(前科:阿里禁用 Claude Code) 渠道风险重评,换官方直充

7. 卡点速查表(11 个实测坑,全部来自 novice_test 实测档,权重最高)

# 修法
1 promptfoo provider 语法 ollama:chat:<model>(冒号不是点号)
2 LightRAG OpenAI 集成接本地嵌入必炸(404/维度 768≠1536) lightrag.llm.ollama.ollama_embed
3 embedding_func 传普通 lambda 崩 用官方包装的 ollama_embed
4 0.5B 小模型做知识图谱 = 0 实体、查询全空 实体抽取 ≥3B
5 CPU 图谱索引慢(2 个小文件 4-5 分钟) 大库改云 API/GPU/增量索引
6 PEP 668:pip 直装被拒 venv 或 pipx(Ubuntu 24+/Debian 13 必踩)
7 OLLAMA_NO_START=1 在 Linux 无效 systemctl disable --now ollama
8 Ollama 固定版本 = 装旧版 装完 ollama --version 对照 GitHub
9 npm 全局装 promptfoo 占 2.6G df -h 确认磁盘
10 Docker 端口裸奔(-p 6333:6333 监听 0.0.0.0) 必须 -p 127.0.0.1:6333:6333
11 cron 静默失败 绝对路径 + >> log 2>&1 + 先手动跑通再加 cron

cron 三铁律(卡点 11 展开):① 脚本和命令全用绝对路径;② 必须重定向日志 >> x.log 2>&1,否则失败无声;③ 先手动跑通,再加 crontab。合并已有 crontab 先 crontab -l > 备份 再追加,别覆盖。


8. 本清单的诚实边界(写给自己看的)

  1. 本文数字全部是截至 2026-09-21 的快照(价格 H0-H1、工具活跃度 H2、架构结论 H3),到期必查——第 30 天打卡的第一项就是干这个的。
  2. "个人用户逼近 AGI"的支持侧结论至今没有第一手案例,本文把它当"待自证假设"处理——第 0 周自证实验就是让你自己产出第一份证据。
  3. 月度纪律刻意只有 2 项。如果你发现自己每月在维护系统上花超过 2 小时,你已经在做可选进阶了——砍掉,回到 2 项。
  4. 唯一实测档证据(novice_test 11 卡点)来自无 GPU/无 GUI/非大陆网络的测试机;你的环境不同,结果可能不同——跑了才算数。
  5. 海外分支(Gemini/OpenRouter/Claude)的价格与政策对大陆读者不可直接迁移;本文以国内生态为准。

定稿:2026-09-21 | 输入:critic.md(§2/§3/§9)、route_attack.md(must-fix 1-12)、freshness.md(监控清单/触发器)、novice_test.md(11 卡点)、cost_route.md(国内价格快照)、master_skeleton.md(6 阶段框架)| 本文半衰期:结构 H3(6 个月复核一次),§2/§3/§7 内具体数字随各自半衰期独立过期。