Wiki 不是 RAG · Karpathy「LLM Wiki」方案 × Building a Second Brain

知识只编译一次,
此后持续保鲜

一个由 LLM 持续编写与维护的、可复利的个人 Wiki 知识库。把"每次提问都从零检索"的 RAG 模式,升级为永久性、结构化、互联的知识资产——每次摄入、查询、健检都让它更值钱。

打个比方:Obsidian 是 IDE,LLM 是程序员,Wiki 是代码库。

为什么需要它

知识工作者的四个结构性痛点

01

知识不复利

RAG 每次提问都在"从零拼图",读过的东西没有沉淀成资产,洞见散落在聊天记录里随对话消失。

02

输入与产出脱节

flomo 笔记、剪藏文章、本地 PDF 各成孤岛;真正要写文章或做决策时,无法快速调用积累。

03

整理即负担

传统笔记法要求人来分类、打标签、建链接,维护成本随规模上升,"整理"本身变成永远做不完的事。

04

随规模腐化

库越大,矛盾、重复、孤立页面越多,却没有机制去发现和修复,知识库逐渐失去可信度。

核心理念

Wiki 不是 RAG

每加入一个新来源,LLM 不是索引它,而是读它、提炼它、整合进已有 Wiki——更新实体页、修订摘要、标注矛盾。知识库是一个持续复利的制品(compounding artifact)。

主流做法 · RAG

检索增强生成

  • 查询时临时检索原始文档片段,拼一次性答案
  • 不留积累,同一问题下次仍从零开始
  • 需要向量数据库与 embedding 基础设施
  • 结论难以回溯与人工修正
本方案 · LLM Wiki

永久性互联知识库

  • 知识只编译一次,交叉引用已建好,矛盾已标注
  • 全部是人类可读的 Markdown,每条结论可回溯来源
  • 架构极简:"只有 markdown、全文检索和 grep"
  • 定期健检(lint)主动发现并修复矛盾与漂移
系统设计

三层架构,权责分明

用一份可版本化的 Schema(CLAUDE.md)当"宪法",明确编译引擎、LLM 与人的边界——这是系统不漂移、不越权的关键。

第三层 · Schema(CLAUDE.md)系统"宪法":规定各角色权责边界、目录规范与工作流,约束下面两层
↓ 约束
第二层 · Wiki(_wiki/)LLM 生成并维护:摘要 / 实体页 / 概念页 / 查询产出;人只读与导航
第一层 · Raw Sources(raw/)剪藏、文章、PDF、flomo 导出;不可修改,唯一真相来源
Raw --编译(只读源,不回写)--> Wiki --调用--> 人:选题 / 提问 / 写作 / 决策
红线一:LLM 绝不直接改写编译引擎管辖的 summaries / concepts / entities,产出只写到 outputs/。
红线二:原始来源只读不写;flomo 原始导出永不修改,只编译增量 delta。
红线三:todo 处理完移入 archive/,不回 clippings/——否则重复编译。

看完整图解:系统如何运作 →

双库布局、七步编译流水线、四道防腐机器、查询两条路与隐私边界,一页看完。

能力全景

六大能力 + 两项支撑

C1

摄入 Ingest

剪藏自动落地编译;重要文章深度对话式摄入;flomo 只处理增量。

C2

编译 Compile

来源编译为结构化互联 Wiki 页,watch 监听、增量幂等、自动更新索引。

C3

查询 Query

先读索引再深入相关页,综合出带来源引用的答案;有价值的产出回写复利。

C4

健检 Lint

发现矛盾、孤立页、缺失交叉引用与数据缺口;安全项自动修复,抗腐化。

C5

素材 Material

双轨框架:六类写作素材抽取 + 五维决策检索,各司其职。

C6

写作 Express

写作前提取素材库 → 写作中即时深挖 → 写作后回写,完整闭环。

S1

治理 Schema

可版本化的权责边界配置,防止 LLM 越权与结构漂移。

S2

自动化 Automation

目录监听、增量检测、编译后归档;一键「全量更新」串起编译到出站,支持网页触发与每日自启。

工程质量

让它规模化不腐化的四道机器

知识库越大越怕漂移与静默腐化。除了理念,系统落了四道**确定性可执行**的机制——不是提示词里的软约束,而是脚本、测试与门禁。

E1

本地检索栈

BM25 + 中文 bigram 分词 + RRF 多通道融合 + 双语同义扩展,秒级本地检索(不走 LLM),索引按输入指纹自动刷新。

E2

评测与回归

检索 golden case(MRR/Top-1)与质量 required/forbidden token 断言锁住认知边界;基线只增不减,改动跑一遍才算数。

E3

决策队列 + 保鲜

须先确认的动作走状态机(审批与执行分离,Dataview 单一看板);重要页按半衰期到点提示复核,只提示不擅改。

E4

写集校验门禁

提交前对变更页跑确定性校验(frontmatter 键值、引号化、保鲜字段、证据链),坏页拦在入库前;有逃生舱不误伤。

开发纪律遵循 Superpowers:测试先行 · 系统化优于拍脑袋 · 简单为第一目标 · 用证据而非声称。脚本改动强制先写会失败的测试,push 前钩子跑全量 pytest。

双轨框架

写作用六类,决策用五维

写作轨 · material/

六类写作素材

  • ① 原创金句 · ② 亲身经历与决策复盘
  • ③ 外部权威与市场信号 · ④ 真实案例
  • ⑤ 框架与心智模型 · ⑥ 数据、研究与趋势
  • 写作前一键生成主题素材库,直接开写
决策轨 · 五维标签

五维工作框架

  • 市场与竞争 · 技术判断 · 产品与用户
  • 人与组织 · 框架与心智模型
  • 产品 / 竞品 / 融资 / 招聘决策时系统化检索
  • 答案聚焦单一维度并跨来源综合
上手

三步跑起来

安装四件套并校验连接Obsidian(存储界面)× sage-wiki(编译引擎)× Claudian(侧栏交互)× Flomo(存量笔记)。后端默认 GLM,可一键切 Kimi。
export GLM_API_KEY=...   # 或 KIMI_API_KEY 切 Kimi
bash scripts/sage-backend.sh   # 看/切后端
sage-wiki doctor
放入存量,首次编译文章进 raw/clippings/,flomo 导出进 raw/flomo/<日期>/。
git init && git add -A && git commit -m init   # 必须先于首次编译
sage-wiki compile
python3 scripts/flomo-delta.py raw/flomo/<日期>
建立每周节奏周一编译+归档 · 周三深度摄入 · 周五 flomo 增量+健检。北极星指标:每周从库里实际调用素材/答案 ≥ 5 次。

系统运作

一页图解:架构、流水线、门禁与隐私边界。

阅读 →

OKF 合规

对照 Open Knowledge Format 的改造:取证、映射、接线与门禁。

阅读 →

安装指南

30 分钟搭好骨架,含首周验收清单。

阅读 →

使用手册

五大工作流、写作闭环与每周节奏。

阅读 →

FAQ 与避坑

12 条风险红线 + 脚本报错排查。

阅读 →

产品需求文档

完整 PRD v1.3:需求、数据模型、评测与规模化。

阅读 →

开发周报

公开仓本周的工程进展、质量门禁与下一步重点。

阅读 →