9.1 Karpathy的LLM Wiki是什么
本节介绍Karpathy的LLM Wiki是什么,并说明需要关注的操作、边界和验收方法。
我们平时用AI总结资料,通常是把一份文件发给AI,让它当场提炼重点。回答在聊天窗口里当时看着挺好,但过几天就沉底找不到了;下次再有新的相关文件进来,AI也不会主动把新旧内容结合起来。
2026年4月,AI领域知名科学家Andrej Karpathy提出了一个知识库构建思路(后来常被称为LLM Wiki):不再让AI只做“一次性总结”,而是让它充当全职资料员,把我们投喂的所有资料持续整理成一套互相链接的知识卡片(Markdown页面),新材料来了就自动更新旧卡片。
从“每次从头翻找”到“持续沉淀加工”
为了更好理解这种区别,我们可以对比两种工作方式:
- 普通AI问答(传统检索):就像你每次有疑问,助理都要把整箱乱七八糟的原始档案全翻一遍,临时拼凑一段话回复你。回答完,档案原样扔回箱子,下次问新问题又得重新翻。
- LLM Wiki(持续知识库):每当你放进一份新文件,AI助理会立刻把它读懂,提炼出核心事实、更新到对应的主题页面里,并打上关联标签。下次你提问时,AI已经对所有背景了然于胸,直接基于整理好的知识库回答,还能精准指出出自哪份原始文件。
这么做最大的好处是:你的每一次调研、每一次提问和纠偏,都会沉淀在知识库里,变成下一次工作的基础,而不是每次都从零开始。
看懂知识库的三层结构
搭建这样一个个人知识库,结构非常简单,只需三个核心部分:
个人知识库/
├── input/ # 原始资料库:只放你收集的原始文件(报告、会议纪要等)
├── wiki/ # 知识沉淀库:Codex 自动整理、持续更新的知识页面
└── AGENTS.md # 维护规则:告诉 Codex 怎样整理分类、如何处理新资料
input/(原始资料库)——只读不改的事实源:这里存放原始报告、会议记录、文章等。这些文件放进来后,Codex只能读取,绝不能擅自修改原文。哪怕原始资料有错,也保留原貌,把疑问记录在知识页面中。wiki/(知识沉淀库)——加工后的知识层:这里存放Codex整理出的主题总结、对比表格、核心概念卡片和索引目录。Codex可以不断新建和更新这些页面,但每个重要结论都必须附带指向原始资料的链接。AGENTS.md(维护规则)——AI的工作说明书:我们在第7章已经学过用它来固定规则。在知识库里,它用来明确告诉Codex:资料该怎么分类、新建页面需要包含哪些要素、遇到新旧内容冲突时如何向你请示。
分清人负责什么、Codex负责什么
在这一套体系中,人和AI的分工非常明确:
- 你负责:挑选靠谱的资料放进
input/、提出分析需求、在出现冲突时做最终裁决。 - Codex负责:阅读长文本、提炼摘要、跨文件归纳信息、自动维护知识页面的链接。
举个例子:新放进的一份会议纪要里提到的项目负责人,与上个月的旧文件不一致。Codex会在整理时敏锐地发现这个差异,标出两份文件的日期,并在知识页面里加上“待确认”提醒,但它不会自作主张替你决定谁是对的,最终仍然交由你来拍板。
守住知识库的四条安全底线
AI整理的知识库虽然高效,但绝不是“绝对可信的万能大脑”。如果原始资料本身有误,整理出的内容也会带有偏差;或者多次改写后,可能会把原本不确定的猜测写成确定事实。
因此,在后面的实践中,我们始终坚持四条底线: 1. 原始材料绝不篡改; 2. 所有关键结论必须能追溯到原始出处; 3. 存疑内容必须标明“待确认”,不能擅自当成定论; 4. 所有知识页面的改动都有历史记录,随时可查可恢复。
有了这四条底线,你的个人知识库才是一套扎实、可靠、越用越顺手的工作资产。