MD 知识库 RAG Skill

MD 知识库 RAG Skill 项目封面

项目概览

MD 知识库 RAG Skill 是一套用于 Markdown/Obsidian 知识库的本地 AI 检索与规则执行方案。目标是让断网大模型也能稳定遵守知识库规则:先检索、再过滤、再基于正式内容回答。

这个项目不是单纯把 Markdown 文件堆在一起,而是把规则区、正式库、索引/MOC、混合检索脚本和原文证据回看流程组织成一个可被 AI 调用的本地知识系统。

访问入口

该项目目前主要是本地知识库与 Codex Skill,不适合直接公开原始内容。作品集里展示结构、规则、检索流程和可公开的 Skill 说明;具体私人笔记、思辨内容和未审核材料不对外开放。

项目介绍视频口径

这段视频可以按 90 秒讲:

  1. 先说明问题:普通 AI 容易跳过规则、混用草稿内容、凭常识补答案。
  2. 展示知识库结构:规则区、正式库、项目区、思辨区、每日记录和检索索引。
  3. 展示混合检索脚本如何召回候选 chunk。
  4. 强调最终回答前必须回到原始 Markdown,并检查 frontmatter、标签和可信边界。
  5. 总结价值:让 AI 不只是“能搜”,而是“按规则搜、按证据答”。

核心设计

规则区决定流程和边界。
正式库提供可调用知识。
索引/MOC 只负责导航。
检索索引只负责召回候选。
模型回答前必须回到原始 Markdown 证据。

我的工作

  • 设计 Markdown 知识库结构,将规则区、正式库、项目区、思辨区和日志区分层。
  • 编写入库审核、路由、标签、正式库入口、混合检索和向量索引等规则。
  • 搭建本地混合检索索引,包含 Markdown 切块、BM25/关键词数据、IDF 权重、向量矩阵和元数据。
  • 编写 build_hybrid_index.pysearch_hybrid.py,支持断网环境下召回候选内容。
  • 将知识库流程封装为 Codex Skill,让模型第一次接入时能自动理解规则、检索边界和回答方式。
  • 明确默认排除范围,包括导入区、处理区、垃圾区、Inbox、Archive、raw、pending、rejected、unverified 等内容。

具体效果呈现

  • AI 进入知识库时先读正式库索引和规则,避免每次全库扫描。
  • 检索索引只负责召回候选,正式结论必须回到原始 Markdown 证据。
  • 支持同一文件结果去重,减少候选 chunk 噪音。
  • 能区分已审核正式内容、项目主页、提炼卡片和未验证材料。
  • 适合项目复盘、个人知识管理、垂直领域知识库和断网 RAG 场景。

技术栈

  • 知识管理:Markdown、Obsidian 风格链接、frontmatter、MOC
  • 检索:BM25、关键词权重、离线 hash-tfidf 向量召回
  • 自动化:Python 脚本、Codex Skill、规则文件
  • 数据结构:chunks.jsonl、vectors.npy、bm25_tokens.json、idf.json、metadata.json

展望与规划

  • 将项目知识库、求职材料和网站内容统一成可检索证据库。
  • 增加更严格的评估集,测试召回准确率、回答引用率和误用草稿率。
  • 为不同领域拆分独立规则,例如项目库、环境法规库、求职材料库。
  • 增加可视化检索面板,让非技术用户也能看到“AI 为什么引用这条材料”。

正在寻找环境 AI 数据工程岗位 欢迎联系沟通。