【社区】搭建个人 AI 办公知识库
摘要:把你的笔记/文档/聊天记录集中起来,让 AI 帮你随时检索。
你需要先知道几个术语
本文术语密度较高,第一次出现都先用大白话解释一遍,后面就直接用了:
- 知识库(Knowledge Base,KB)= 把你零零散散的笔记、文档、聊天记录集中到一个能随时检索的地方。不是"文件夹",是"AI 能读懂、能搜、能回答"的仓库。
- RAG(Retrieval-Augmented Generation,检索增强生成)= 让 AI 先从你的知识库里搜答案,再回话。比"把整个文档粘进对话框"更准、比"训练 AI"更便宜,是当下最实用的方案。
- embedding(向量嵌入)= 把一段文本变成一串计算机能算的"数字指纹"(专业点说叫"高维向量")。意思相近的文本,数字指纹也接近。
- 向量数据库(vector database)= 专门存"数字指纹"、支持"找最像"的数据库,比如 Coze/Dify 内置的、还有独立的 Milvus、Pinecone 等。
- Coze / Dify / 扣子= 国内常见的"无代码搭 AI 应用"平台,允许不写代码就搭一个"问 PDF/问笔记"的机器人。扣子是字节跳动 Coze 的国内版,功能基本一致。
- AI 浏览器插件= 装在浏览器(Chrome / Edge)里的 AI 助手,可以对当前网页"问答/总结/翻译",代表产品 Monica、秘塔搜索、MaxAI、豆包浏览器插件。
- OCR(Optical Character Recognition,光学字符识别)= 把图片/PDF 扫描件里的字"抠出来"变成可编辑文字的技术。
这篇文章是个人版,团队怎么搭知识库另看 C4《实战:用 AI 知识库沉淀团队 SOP》。个人版和团队版的区别:个人版数据只对自己,自由度更高,但隐私风险也更大(因为没人替你审)。
一、痛点引入
周五下午,老板让你把去年那个项目的合同翻出来,顺便找找当时的谈判记录。
你打开电脑,一阵头大:
- 项目笔记在印象笔记里,但你 3 个月前切换到了 Obsidian,旧笔记没同步;
- 合同 PDF 在微信文件里,微信只给你留 90 天;
- 谈判过程你跟 ChatGPT 聊过 3 次,但新开对话框 AI 又失忆了;
- 客户发来的报价单是 5 张手机截图,你懒得一张张敲字。
你翻了一下午,找出来 4 个版本,一对内容还相互矛盾。最后老板说"算了,口头说一下吧"。
这种"找自己写过的资料比从网上搜还难"的场景,是个人知识管理的最大痛点。背后的根因有 3 个:
- 笔记散在 N 个工具:Notion 一份、Obsidian 一份、Apple 备忘录一份、微信收藏一份、印象笔记一份……每个工具各管一摊,没一个能"通读"。
- 格式不利于 AI 读取:截图、长 PDF、混杂排版——AI 看不见图里的字、读不懂 PDF 的扫描页。这就是为什么"把整个 PDF 粘给 ChatGPT"经常答非所问。
- AI 不记得你:每次开新对话,AI 都失忆。"我上周不是跟你说过吗"这句话对 AI 没用——它真的不记得。
这篇文章就解决这 3 件事:统一收纳 → AI 友好化 → 让 AI 检索。学完你能搭一个问什么都答,答的都来自你自己笔记的"私人 AI 助手"。
关键认知:这不是为了"显得专业",而是为了省钱省时间。你能"问自己的笔记",意味着不用反复回忆、不用重读 100 页 PDF、不用重新告诉 AI 你的项目背景。预计每周省 2-4 小时"找资料时间"。
二、目标产出
照着做完,你手上会有 5 样东西:
- 一份"个人笔记盘点清单"(
.md或表格):列出所有笔记/文档当前在哪、多少量、有多少是"AI 读不出来"的(图、扫描件、微信文件)。一张表看清"我到底有多少知识"。 - 一个统一收纳平台(4 选 1):Notion / Obsidian / 飞书个人空间 / 语雀,所有笔记只往这一个地方塞。
- 1 个"问自己的笔记"的机器人:用 Coze / Dify / 扣子 自建,把个人笔记喂进去,以后用自然语言问"去年 X 项目报价多少",AI 自动回。
- 1 个浏览器级 AI 插件(Monica / 秘塔搜索 / MaxAI 三选一):看网页/翻资料时即时问答。
- 一份"AI 友好"个人笔记模板(直接复制用):保证新写的笔记天然能被 AI 读取。
前置条件
| 项目 | 最低要求 | 说明 |
|---|---|---|
| 个人笔记存量 | 50 篇以上 | 没笔记就没必要搭 AI 知识库,先把笔记攒起来 |
| 主力平台 | Notion / Obsidian / 飞书个人空间 / 语雀 4 选 1 | 别再用第 3 个,统一为先 |
| AI 助手 | ChatGPT 或国内任一大模型 | 搭机器人时要用,Coze/Dify 都内置 |
| 自建机器人工具 | Coze / Dify / 扣子 任一 | 后文 3 选 1 详细讲,前者最简单 |
| 浏览器 | Chrome / Edge | 装插件用,Safari 兼容性差 |
| 隐私自查 | 1 张清单(本文给) | 必做,哪怕是个人版 |
关于"能力边界"的声明(先看):本文涉及 4 款主力平台、Coze/扣子、Dify 等自建机器人工具、3 款浏览器插件。各家版本/计费/功能差异很大,本文写到的"能/不能"以 2025 年公开信息为准。落地前请先去对应产品后台确认当前能力,别照搬文中的步骤。文末有「风险点汇总表」,集中标注不确定项。
三、案例实战
咱们用**一个虚构的"产品经理小李"**做案例:小李工作 5 年,笔记存量约 800 条(Notion 300 + 印象笔记 400 + 微信收藏 100),最近想搞个人 AI 知识库。
下面分两步走:第 1-3 步打地基(选平台/导笔记/建模板),第 4 步三种"问答模式"3 选 1 或组合(案例 A 平台 AI / 案例 B 自建机器人 / 案例 C 浏览器插件),第 5 步验真伪(测试集),第 6 步养起来(日常维护)。
第 1 步:选平台、定边界(半天)
这一步是"地基",选错了后面全白干。铁律:只在 1 个地方写笔记,别再"哪里方便写哪里"。
路径 A:Notion + Notion AI
- 适合:已经用 Notion、写 Markdown 偏多、需要跨设备同步(网页/桌面/手机)。
- 优点:UI 友好,模板多,数据库视图强。
- 缺点:免费版单文件 5MB,大 PDF 存不下。
- 关键能力:Notion AI 2024-2025 开放了"Q&A over workspace"(向整个工作区提问),不是简单"在当前页问 AI"。
路径 B:Obsidian + AI 插件
- 适合:笔记量大(1000+ 条)、本地党、想"数据自己掌控"。
- 优点:数据全在本地.md 文件,纯文本,可永久存档;双链笔记(把笔记 A 链接到笔记 B)做"个人知识图谱"最丝滑。
- 缺点:手机端体验差;同步要自己解决(iCloud/坚果云/Git)。
- 关键插件:Smart Connections(开源)或 Copilot for Obsidian(付费),都能对整个 vault 提问。
路径 C:飞书个人空间 + 智能伙伴
- 适合:工作里本来就在用飞书的人。
- 优点:用飞书就是"顺手",个人空间+团队空间共用一套 AI。
- 缺点:个人空间免费额度有限,大库要付费。
路径 D:语雀 / 其他(极简)
- 适合:不想折腾插件、不想学新工具的人。
- 优点:蚂蚁出品,中文最舒服;有"知识库"概念原生的支持。
- 缺点:社区没前 3 个大,模板少。
4 选 1 的判断标准
| 维度 | Notion | Obsidian | 飞书个人 | 语雀 |
|---|---|---|---|---|
| 国内访问 | 偶尔抽风 | 完美 | 完美 | 完美 |
| 中文支持 | 中英文混 | 完美(自己写) | 完美 | 完美 |
| 上手难度 | 低 | 中(要学插件) | 极低 | 极低 |
| 数据掌控 | 云端,Notion 能看 | 本地,完全掌控 | 云端,字节系 | 云端,蚂蚁系 |
| AI 能力 | Notion AI 强 | 靠插件,够用 | 智能伙伴,中文最优 | 较弱 |
| 移动端 | 良好 | 一般 | 良好 | 良好 |
小李的选择:Notion(已经用了 300 篇,迁移成本最低)。
坑点 1:别追求"完美平台",先选"够用 + 已经用"。数据迁移成本永远比"功能差距"高。80% 的功能你用不上,先跑起来比选强。
第 2 步:批量导入旧笔记(1 天)
这一步是"脏活",但不做不行——旧的笔记导不进来,知识库就是空的。
2.1 从其他平台导出
- 印象笔记 → 导出
.enex→ 用 evernote2md 这类开源工具转.md→ 批量导入 Notion/Obsidian。 - 有道云笔记 / Bear / Apple 备忘录 → 大多支持导出 Markdown 或 HTML。
- Word / Excel / PPT → Notion 直接拖入即上传;Obsidian 用 Pandoc 转
.md。 - 微信文件 → 关键!微信只保留 90 天,过期的要立刻手动长按"另存为"或转发到"文件传输助手"。
- 本地文件夹 → 直接拖入。
2.2 把图和扫描件"AI 可读"
最痛的是这一类:手机截图、扫描 PDF、聊天记录截图。AI 看不见图里的字(默认情况下),必须 OCR 一次。
OCR 工具 3 选 1:
| 工具 | 价格 | 适合 | 准确率 |
|---|---|---|---|
| 百度网盘内置 OCR | 免费(限次数) | 中文扫描件、教材 | 高 |
| 微软 OneNote | 免费 | 英文/混排 | 高 |
| 腾讯文档 OCR | 企业版 | 表格/合同 | 高 |
操作流:
- 把所有截图/PDF 集中到一个文件夹;
- 批量 OCR(多数工具支持"拖文件夹自动处理");
- OCR 完务必人工对一遍,特别是手写批注、复杂表格、扫描件背景;
- 把校对后的文字 + 原图一起存到知识库(别只存图)。
坑点 2:OCR 完不校对 = 自己骗自己。OCR 对手写体、扫描噪声、复杂排版的识别率显著下降,识别错的字意思就全反了(比如"金额 5000"被识别成"金额 30000")。AI 读到错字,会一本正经地按错字回答——你不会发现。
第 3 步:用 AI 友好模板结构化新笔记(半小时)
90% 的个人笔记是"给自己看的",不是"给 AI 检索用的"。两个最大的问题:
- 标题是"项目说明""流程介绍"这种泛词——AI 不知道这是哪类笔记;
- 段落里塞了太多上下文——AI 检索是按关键词匹配,不是"读小说"。
下面这份 Markdown 模板,专为"AI 检索 + 未来自己回头找"双友好设计。直接复制粘贴用:
markdown# [笔记标题:动词 + 对象 + 笔记类型] # 例:2024 年 X 项目报价策略 / 读《原则》第一章要点 ## 主题 (用 30 字以内讲清"这是干啥的") ## 关键事实 - 要点 1: - 要点 2: - 要点 3: (3-5 条,AI 检索最常命中这里) ## 详细内容 (完整内容,尽量用结构化:列表/表格/代码块,少用大段) ## 来源 - 链接 / 书名 / 页码 / 微信聊天日期 / 会议日期 ## 我的思考 (这一段是"我"的,AI 不会和别人笔记撞) ## 标签 #项目A #决策模型 #2024 ## 更新日期:2025-01-15
关键原则:
- 标题用"动词 + 对象 + 类型",比如"X 项目报价策略笔记"而不是"项目说明";
- 关键事实单独成段,这是 AI 检索的"高命中率区";
- 我的思考单独成段,因为这是你的独门见解,别人笔记里不会有。
坑点 3:别用 PPT/Word 当知识库源。PPT 截图里全是图,Word 有复杂格式——AI 读不出来。Markdown 是最 AI 友好的格式。
第 4 步:3 种"问自己的笔记"模式(2-3 天,3 选 1 或组合)
到这一步,你已经有"统一收纳 + AI 友好格式"的笔记库了。怎么让 AI"读"它们,3 种模式 3 选 1 或组合——本文给 3 个真实可复制的子案例。
子案例 A(最简单):用 Notion AI 问问问
适用:你选了 Notion,且 Notion AI 能用。
- 打开 Notion → 右上角问号/AI 按钮 → 点 "Ask Notion AI" 或 Q&A 入口;
- 在对话框输入"去年 X 项目报价多少",或"我读过的决策模型笔记有哪几篇";
- Notion AI 自动从你的 workspace 里搜答案,回答下方有"来源"链接,点开跳原页;
- 如果是英文/海外笔记多,Notion AI 表现更好;中文/国内笔记多,飞书智能伙伴更丝滑。
不确定标注:Notion AI 的 Q&A over workspace 功能 2024-2025 持续迭代,免费版通常不含,需 Notion AI 附加包或 Business/Enterprise 计划。具体看你账号右上角有没有 AI 按钮。
子案例 B(技术进阶):用 Coze 或 Dify 搭一个"问 PDF/问笔记"机器人
适用:你笔记量大、要"24 小时在线问答"、愿意学一点配置。
准备工作:
- 注册 扣子(coze.cn)(字节,国内,免费额度够用)或 Dify(开源,可自部署);
- 选一个 LLM 模型(扣子内置豆包/通义,Dify 可接任意)。
用扣子搭 5 步(最省事路径):
步骤 1:建知识库
- 登录扣子 → 进 "个人空间" → 点 "知识库" → "创建知识库";
- 知识库名:"我的个人笔记";
- 把你的笔记文件(
.md/.pdf/.docx/.txt)批量上传;扣子支持 1 次拖入多个文件;单文件最大:50MB(2025 年初口径,以你账号实际为准); - 上传完,扣子会自动 OCR(对 PDF/图片)、切段、向量化——这一步你不用管,等它跑完。
步骤 2:建机器人
- 进 "工作流/插件" 之外的 "创建 Bot";
- 基础设置:Bot 名 "我的笔记助手",简介 "基于我个人笔记训练的问答助手,只回答我笔记里写过的问题"。
步骤 3:挂知识库
- Bot 设置面板 → "知识库" 选项 → 选刚才建的"我的个人笔记";
- 设置检索策略:召回 Top-K = 5(从知识库里召回 5 段最相关的喂给 LLM);最低相似度 0.5(低于这个分数的片段不喂,避免乱回答);
- "按时间筛选" 不用开(个人笔记一般不过期)。
步骤 4:写提示词(灵魂)
扣子机器人的"人设与回复逻辑"框里,贴下面这段(直接复制):
你是"小李的笔记助手"。
你的唯一知识来源:用户名为"我的个人笔记"的知识库。
- 你**只能**用知识库里的内容回答;
- 知识库里没写过的,直说"你的笔记里没写过这个,我无法回答",不要瞎编;
- 回答时必须给出 1-3 条引用(笔记标题或文件名),方便用户回查;
- 语气:简洁、像助手,不要套话("赋能/抓手/闭环/拉通"都用不上);
- 默认中文回答,如果用户用英文问就用英文回答,但引用仍然是原文标题。
回答格式:
1. 答案正文(2-5 句话)
2. 参考:[标题1]、[标题2]步骤 5:发布
- 点 "发布" → 选 "微信客服" / "豆包" / "掘金"任一发布渠道(个人用选"豆包"或"API 调用"最方便);
- 或直接用扣子的 "预览" 窗口测试。
测试问题:
Q1(基础事实):2024 年 X 项目报价多少?渠道分成比例是多少?
Q2(操作细节):我收藏的《原则》第一章里,作者对"痛苦+反思=进步"是怎么说的?
Q3(边界测试):我读过的书里有讲"敏捷开发"吗?
Q4(陷阱测试):我笔记本里推荐过哪款咖啡?(故意问知识库里没有的)期望表现:
- Q1 → 答具体数字,引用笔记标题;
- Q3 → 列笔记列表;
- Q4 → "你的笔记里没推荐过咖啡,我无法回答"(AI 承认不知道,这是最重要的能力)。
不确定标注:扣子/Dify 的具体功能(知识库大小、Bot 调用次数限制)2024-2025 快速迭代,以你登录后台看到的当前版本为准。
Dify 的差异:
- Dify 开源,可自部署,数据完全掌控(部署在自己服务器上);
- 适合"我有 1000+ 篇笔记、要本地化、懂点 Docker"的人;
- 配置流程与扣子类似,但多一步"装 Dify + 选 embedding 模型 + 装向量数据库(如 Qdrant)"——门槛更高,但自由度也更高。
子案例 C(即时检索):用 Monica / 秘塔搜索 / MaxAI 浏览器插件
适用:你 80% 的"知识"其实是正在浏览的网页,不需要"入库",直接对当前网页 AI 问答。
3 选 1:
| 插件 | 价格 | 强项 | 适合 |
|---|---|---|---|
| Monica | 免费版够用,Pro 约 ¥30/月 | 通用 AI,支持 GPT-4/Claude,英文/海外资料强 | 看英文资料多 |
| 秘塔搜索 | 完全免费 | 中文搜索 + AI 摘要,国内资料极强 | 看中文网页/搜中文资料 |
| MaxAI | 免费版有限,Pro 约 ¥40/月 | 多模型(ChatGPT/Claude/Gemini),功能多 | 想"一站式" |
安装(以 Monica 为例):
- Chrome 应用商店搜 "Monica" → 装好;
- 打开任意网页 → 点 Monica 图标 → 选 "Chat with this page";
- 输入"这篇 30 页报告的核心结论是什么",Monica 自动抓当前网页内容 → AI 回答;
- 进阶:把回答存到你的 Notion/Obsidian(手粘一下,或配合 IFTTT/Zapier 自动同步)。
典型用法:
- 看英文论文 → 点 Monica → "翻译并提炼方法";
- 看产品文档 → 点 Monica → "第 3 步具体怎么操作";
- 看行业报告 → 点秘塔 → "国内 A 赛道 2024 年市场规模多大"(秘塔自带联网搜索)。
3 种模式可以组合:平台 AI(Notion Q&A)处理"查我的旧笔记" + 自建机器人(Coze)处理"24 小时在线问答" + 浏览器插件(Monica)处理"看新网页时即时检索"。小李最终用的是:Notion Q&A + 扣子机器人 + Monica 插件。
第 5 步:写 20 题测试集,验证 AI 真本事(半天)
和 C4 一样,测试集是防 AI 翻车的核心。你问"去年 X 项目报价多少",AI 答得看起来很专业——但你不确定它是不是"读懂了笔记"还是"在编"。
测试集模板(.md 文件,直接复制):
markdown# 个人 AI 知识库测试集(20 题) ## 基础事实题(测试 AI 能否查"是什么") **Q1**:2024 年 X 项目报价多少?分成比例是多少? - 标准答案要点:抽成 X%、客单价 Y 万、签了 N 家 - 来源笔记:2024 年 X 项目报价策略.md **Q2**:我读过的《原则》一书的作者,对"痛苦+反思"是怎么说的? - 标准答案要点:痛苦+反思=进步 - 来源笔记:《原则》读书笔记.md ## 操作细节题(测试"怎么做") **Q3**:我收藏的某篇博客里推荐的 Python 学习路径是什么? - 标准答案要点:入门 → 进阶 → 实战三阶段 - 来源笔记:Python 学习路径.md ## 跨笔记综合题(测试"会不会联想") **Q4**:我读过的所有关于"决策"的书,共同点是什么? - 标准答案要点:列 2-3 本书 + 共同关键词 - 来源笔记:多本读书笔记 ## 边界题(测试"什么不知道") **Q5**:我笔记里有讲"咖啡冲泡"的内容吗? - 期望答案:"没有"或"仅在 X 篇里出现过一次" - 期望表现:不瞎答 ## 陷阱题(测试"会不会编") **Q6**:请告诉我"我笔记本里推荐过的咖啡机型号"——故意问一个笔记里没有的 - 期望答案:"你的笔记里没推荐过咖啡机型号" - 期望表现:**AI 承认不知道**,而不是瞎答一个品牌
打分:
- 完全正确(覆盖所有标准要点 + 引用正确)= 1 分
- 部分正确(答对一半以上,但漏了关键细节)= 0.5 分
- 瞎编或拒绝(编了一个笔记里没有的答案 / 直接说"不知道"该不该说的)= 0 分(扣分)
合格线:总分 ≥ 16/20。不及格,回头修笔记(不是修 AI)——见下一节避坑指南"坑 3"。
第 6 步:日常使用 + 季度复盘(持续)
这一步是把"个人 AI 知识库"养起来的关键。
6.1 装一个轻反馈按钮
机器人/平台 AI 的回答旁边,加一个反馈(扣子支持 👍/👎,Notion AI 也支持):
- 👎 反馈每周汇总一次;
- 看哪些问题答不上 → 回去补笔记(在对应笔记的"常见问题 FAQ"里加一条)。
6.2 每季度 1 次"笔记复盘"
每季度花 1 小时:
- 删掉过时笔记(项目 X 已经黄了,笔记留着也没用);
- 更新关键事实(合同金额变了、客户对接人换了);
- 重新跑一遍 20 题测试集(防"答得越来越错")。
关键点:别搭完就以为搞定,知识库的"新鲜度"靠你维护。最常见的失败:搭了 3 个月很兴奋,半年后没维护,问到的全是过期答案,然后你说"AI 不行"。
跑完这 6 步,你手上就有:
- 一个统一收纳平台(Notion / Obsidian / 飞书个人 / 语雀);
- 800 条笔记批量导入 + AI 友好模板;
- 1 个"问自己的笔记"的机器人(扣子);
- 1 个浏览器级即时检索插件(Monica / 秘塔 / MaxAI);
- 1 份 20 题测试集 + 季度复盘机制。
四、原理小结
一句话讲清底层:个人 AI 知识库 ≈ 笔记本 + 搜索引擎 + 翻译官。
技术上仍然是 RAG,三步走(和 C4 团队版一样,但数据源从"团队文档"换成"个人笔记"):
- 笔记入库时:把你的笔记切成小段(每段 300-500 字,段间 overlap 50-100 字防切断关键信息),每段用一个 embedding 模型(扣子内置豆包 embedding,Dify 可选
text-embedding-3-small等)转成"数字指纹",存进向量数据库(扣子内置、Qdrant、Milvus 等)。 - 你提问时:把你的问题也转成"数字指纹",去向量数据库里"找最像的 3-5 段"——Top-K 检索。
- AI 回答时:把这 3-5 段作为"参考资料",连同你的问题一起发给 LLM,让 LLM 基于这些资料"组织语言回答",并标注引用。
关键点:LLM 在这个过程中是"翻译官",不是"知识源"。它的知识源永远是那 3-5 段检索到的笔记。这意味着:你笔记写得对,AI 答得就对;你笔记写得烂,AI 答得就烂——AI 不是锅。
为什么"自己读"不如"AI 读"
- 速度:人类读 50 篇笔记要 4 小时,AI 检索 5 秒;
- 记忆:人会忘,AI 不忘(只要笔记没删);
- 跨笔记联想:人脑回忆"我读过的所有决策类书"会漏,AI 一次性跨 100 篇检索;
- 持续性:AI 24 小时可用,你不休息。
为什么个人版"够用 RAG,不用 fine-tuning"
- RAG 便宜:笔记本更新即可生效,不用重新训练。
- RAG 可追溯:回答带"来源引用",错了能溯源。
- RAG 隐私可控:笔记本只在你的向量数据库里,你删笔记,AI 就忘。
对个人用户的建议:99% 的场景用 RAG 就够了,别碰 fine-tuning——后者是"项目级"的事,不是"个人笔记级"的事。
五、避坑指南
这条路上我替你踩过 6 个坑,逐条点出来。
坑 1:别把所有笔记都喂给 AI
很多人想"省事",把 Notion 全工作区、整个 Obsidian vault、甚至微信聊天记录全喂给 AI。问题有三:
- 过期笔记污染答案:3 年前的项目笔记混在里头,AI 会拿过期版本回答;
- 无关笔记干扰检索:"我哪本书好看"这种感想笔记和**"项目报价策略"这种工作笔记**混在一起,检索时 AI 经常命中错的;
- 敏感信息暴露(详见坑 2)。
正解:只喂"主题清晰的笔记",挑主题。比如扣子知识库可以建多个(工作 / 学习 / 生活 / 收藏),按需挂到不同 Bot,不让一个 Bot "啥都答"。
坑 2:隐私红线,自己审自己
绝对不能喂 AI 的内容(触发《个人信息保护法》《数据安全法》、欧盟 GDPR 等):
- 自己的身份证号 / 银行卡号 / 密码 / 验证码(及截图);
- 他人(同事、朋友、客户)的身份证 / 联系方式(未经授权);
- 私人聊天记录(婚姻/医疗/财务);
- 工作中"内部分发"的保密文档(标的未公开财报、客户名单、未发布方案);
- 自家孩子的身份证号 / 学校 / 定位信息;
- 任何你"不希望被第三方看到"的内容。
正解:建知识库前过一遍"能不能给 AI"的清单。哪怕是"个人 AI",扣子/Dify 用的是云端大模型,你的笔记会上传到云端做向量化,平台有数据保留策略(扣子 2024 年公开声明:"用户数据用于模型推理,默认不用于训练",但具体看 ToS)。保险做法:敏感笔记留本地,不喂云端。
坑点 4:很多人觉得"反正只有我自己用"——但扣子/Dify 是 SaaS(软件即服务),数据出境/平台日志/被攻击泄露,每一个都是风险。个人隐私和企业隐私一样需要画红线。
坑 3:AI 一定"看起来很专业地编"
你问"X 项目报价多少",AI 答得头头是道,你不能假定它对。必须用 20 题测试集(第 5 步)过一遍。
正解:
- 回答必须带"引用"——扣子/Dify 都支持,没引用 = 不可信;
- 陷阱题至少 3 道——故意问笔记里没写过的,验证 AI 会不会承认不知道;
- AI 越自信,越要警惕——它答"我记得你写过 X"和答"你的笔记第 3 条是 X"语气上几乎一样。
坑 4:大笔记切小块,避免关键信息被切走
RAG 的切片策略直接决定"答得对不对"。
典型翻车场景:
- 一个 80 页 PDF 整篇丢给 AI → 切片时"金额 5000 元"恰好被切到段尾,"渠道分成 30%"在下段开头,两段不连了;
- 一篇笔记 3000 字不切 → 整段喂 AI,3000 字里全是项目 X 的内容,但 AI 只引用了前 500 字(因为只召回 Top-5)。
正解:
- 每段控制在 300-500 字;
- 段间 overlap 50-100 字(扣子默认就是这套策略,但 Dify 自建时要手动设);
- 标题要单独成段(不参与切段),保证 AI 检索时能命中标题。
坑 5:别依赖单一平台(数据备份)
平台都可能挂。Notion 2022 年、2023 年都出现过全球性宕机;Obsidian 本地数据硬盘坏了就完蛋;扣子也是 SaaS,数据在他们服务器上。
正解:至少双备份:
- Notion 笔记 → 每周导出 Markdown 到本地(Notion 右上角 Export);
- Obsidian 笔记 → 同步到 iCloud / Git / 坚果云(三选一,别只用本地硬盘);
- 扣子知识库 → 原始文件自己保留一份(上传过什么自己留一份),扣子未来下线不影响你。
坑 6:别忽略 OCR 和格式清洗
很多个人笔记的"原料"是截图、PDF 扫描件、微信文件。直接喂 AI = 喂了一堆噪音。
正解:
- 图片/PDF 扫描件先 OCR;
- OCR 完人工对一遍(抽样 10% 校对);
- OCR 后的文字 + 原图都存到知识库(后续如果发现 AI 读错了,还有原图可参考);
- 截图比"内容"重的笔记,优先手动转成 Markdown。
六、进阶延展
跑通基础版之后,4 个方向可以再深入一步。
1. 从个人版升级到团队版(主线推荐)
当你的个人笔记库稳定了(笔记 1000+ 条,且每周有用上 3 次以上),可以考虑"团队化"——也就是 C4《实战:用 AI 知识库沉淀团队 SOP》要讲的事。个人版 → 团队版的关键差异:
- 数据从"自己的私人笔记"变成"团队的共享 SOP",需要权限分级;
- 需要"负责人"和"更新频率"——团队里没人维护,文档就死;
- 隐私红线从"个人隐私"扩到"客户数据/薪资/合同"——必须过法务审。
直接跳到 C4 读,本文不展开。
2. 加"长期记忆",让 AI 记得你聊过什么
RAG 是"读笔记",长期记忆是"记对话"。两者结合,AI 可以:
- 记住"你习惯用思维导图梳理需求"(对话里反复出现);
- 记住"你最近在学 Coze"(对话里更新过);
- 在回答时主动调出"你上次也问过类似问题,当时是这么解决的"。
主流 LLM 长期记忆(2025 年初公开口径):
- ChatGPT Memory 自 2024-02 起向 Plus/Team 计划开放;
- Claude 的 Projects(跨对话知识空间)2024 年 10 月就已上线,后续持续增强;
- 通义在部分场景上线记忆功能;
- 扣子 Bot 也有"用户记忆"能力(自定义 Bot 时开启)。
谨慎开启——记多了就是隐私风险。建议只开"事实记忆",不开"对话记忆"(前者只记关键事实,后者会记每句对话)。
3. 多模态——把图、音、视频也喂进去
当前 RAG 主要处理文本。个人版的进阶方向:
- 图片:截图 / 表情包 / 照片,扣子/Dify 都支持图片入库;但检索时 AI 看的是"图片描述",不是图本身——你得给图加 alt 文字(用 OCR);
- 音频:会议录音、播客,先用 ASR(语音转文字,如 Whisper / 飞书妙记)转文字 → 入知识库;
- 视频:B 站收藏 / 培训视频,自动加字幕后入知识库。
这些能力多数平台 2024-2025 逐步上线,功能边界变动快,落地前先确认。
4. 自动化流水线——让笔记"自动进知识库"
进阶玩法:新写的笔记自动入库,不用手动上传。
- Notion → 配合 Zapier / Make(原 Integromat),新页创建 → 自动触发 → 上传到扣子知识库;
- Obsidian → 用 Templater 插件 + 钩子,保存笔记 → 自动调 API 上传;
- 微信文章 → 配合"微伴"等工具,收藏 → 自动转 Markdown → 入库。
注意:全自动流水线有"噪音风险"——你不想要的笔记也会进。建议半自动:人工确认后再入。
下一步:当你个人版的知识库稳定之后,你已经为"团队版"准备好了 80%。C4《实战:用 AI 知识库沉淀团队 SOP》会讲怎么把"个人玩法"升级到"团队玩法"——加权限分级、加 SOP 模板、加负责人机制、加法务审查。这是从"个人效率工具"到"团队知识资产"的关键一步。