MD 知识库 RAG Skill
项目概览
MD 知识库 RAG Skill 是一套用于 Markdown/Obsidian 知识库的本地 AI 检索与规则执行方案。目标是让断网大模型也能稳定遵守知识库规则:先检索、再过滤、再基于正式内容回答。
这个项目不是单纯把 Markdown 文件堆在一起,而是把规则区、正式库、索引/MOC、混合检索脚本和原文证据回看流程组织成一个可被 AI 调用的本地知识系统。
访问入口
该项目目前主要是本地知识库与 Codex Skill,不适合直接公开原始内容。作品集里展示结构、规则、检索流程和可公开的 Skill 说明;具体私人笔记、思辨内容和未审核材料不对外开放。
项目介绍视频口径
这段视频可以按 90 秒讲:
- 先说明问题:普通 AI 容易跳过规则、混用草稿内容、凭常识补答案。
- 展示知识库结构:规则区、正式库、项目区、思辨区、每日记录和检索索引。
- 展示混合检索脚本如何召回候选 chunk。
- 强调最终回答前必须回到原始 Markdown,并检查 frontmatter、标签和可信边界。
- 总结价值:让 AI 不只是“能搜”,而是“按规则搜、按证据答”。
核心设计
规则区决定流程和边界。
正式库提供可调用知识。
索引/MOC 只负责导航。
检索索引只负责召回候选。
模型回答前必须回到原始 Markdown 证据。
我的工作
- 设计 Markdown 知识库结构,将规则区、正式库、项目区、思辨区和日志区分层。
- 编写入库审核、路由、标签、正式库入口、混合检索和向量索引等规则。
- 搭建本地混合检索索引,包含 Markdown 切块、BM25/关键词数据、IDF 权重、向量矩阵和元数据。
- 编写
build_hybrid_index.py与search_hybrid.py,支持断网环境下召回候选内容。 - 将知识库流程封装为 Codex Skill,让模型第一次接入时能自动理解规则、检索边界和回答方式。
- 明确默认排除范围,包括导入区、处理区、垃圾区、Inbox、Archive、raw、pending、rejected、unverified 等内容。
具体效果呈现
- AI 进入知识库时先读正式库索引和规则,避免每次全库扫描。
- 检索索引只负责召回候选,正式结论必须回到原始 Markdown 证据。
- 支持同一文件结果去重,减少候选 chunk 噪音。
- 能区分已审核正式内容、项目主页、提炼卡片和未验证材料。
- 适合项目复盘、个人知识管理、垂直领域知识库和断网 RAG 场景。
技术栈
- 知识管理:Markdown、Obsidian 风格链接、frontmatter、MOC
- 检索:BM25、关键词权重、离线 hash-tfidf 向量召回
- 自动化:Python 脚本、Codex Skill、规则文件
- 数据结构:chunks.jsonl、vectors.npy、bm25_tokens.json、idf.json、metadata.json
展望与规划
- 将项目知识库、求职材料和网站内容统一成可检索证据库。
- 增加更严格的评估集,测试召回准确率、回答引用率和误用草稿率。
- 为不同领域拆分独立规则,例如项目库、环境法规库、求职材料库。
- 增加可视化检索面板,让非技术用户也能看到“AI 为什么引用这条材料”。