baojie/shiji-kb

▲ 124 stars today★ 3,196⑂ 507

About baojie/shiji-kb

baojie/shiji-kb is an open-source project on GitHub, mainly written in HTML. It currently holds 3,196 stars and 507 forks with 50 open issues, and was last pushed on 2026-08-31 (repository created 2025-03-12).

Project Overview

Git Homed tracks it on the Today's Trending board, currently at rank #36 with 124 new stars today.

GitHub Repository Details

Repository baojie/shiji-kb · default branch main · size 797115 KB · watchers 33 · source: GitHub REST API and repository README

README

史记知识库 - 让两千年的文字活过来

两千年来我们读《史记》,现在让机器帮我们"看见"隐藏的知识网络。

在线阅读(GitHub Pages): https://baojie.github.io/shiji-kb | Wiki: https://baojie.github.io/shiji-kb/wiki/

在线阅读(自有域名 · 备用/国内更快): https://shiji.memify.wiki/ | Wiki: https://shiji.memify.wiki/wiki

报告问题: 提交Issue (推荐截屏+paste) 许可证: CC BY-NC-SA 4.0

学术文献请引用:鲍捷,史记知识库,2026,在线发布于https://github.com/baojie/shiji-kb

---

这是什么?

一句话介绍:用AI将《史记》57万字转化为可交互、可探索的知识图谱,让两千年前的文字像代码一样可以语法高亮、跳转、搜索、推理。

核心成果(2026-05-14):

近期里程碑(2026-05-14): 适合谁? ---

快速体验

在线阅读器

| 站点 | 地址 | 说明 | |------|------|------| | GitHub Pages | https://baojie.github.io/shiji-kb | 主站,通过 CDN 全球分发 | | shiji.memify.wiki | https://shiji.memify.wiki/ | 备用站,服务端渲染,国内访问更稳定 |

精选章节(两个站点均可访问):

核心功能

阅读器演进五层次

从原始文本到全功能知识库:

原文 → 专名标注 → 语法高亮 → 语义排版 → 关系连线

查看完整演进过程 | 语义排版技术细节

---

三大突破

🎯 Agentic Ontology:AI时代的知识工程新范式

| | 传统本体构建(2001) | Agentic Ontology(2026) | |--|---------------------|---------------------------| | 起点 | 专家在Protégé中从空白开始 | AI从原始文本中提取 | | 方向 | 自上而下设计 | 自下而上涌现 | | 规模 | 数十个类、数百个实例 | 数千个类、数万个实例 | | 迭代速度 | 数周一轮 | 数小时一轮 | | 核心瓶颈 | 2001: 设计 | 2026: 反思/进化 |

核心转变:2001年的难点是"设计本体",2026年的难点是"反思/进化AI提取的本体"。本体不再是专家预先设计的蓝图,而是从数据中生长出来、由人类修剪和校准的有机结构。

详见方法论对标文档:Agentic Ontology 101(英文,对标Noy & McGuinness 2001经典)

📚 可复用方法论:从一部书到整个文库

总控SKILL - 完整管线操作指南

14个元技能(Meta-Skills) - 通用知识工程方法论 89个管线技能(Pipeline Skills) - 古籍处理完整技术栈 技术文章 - 方法论实战解读 为什么是SKILL而非代码?

四个关键原因:

1. 灵活性:每个研究问题都不同。传统代码需要重写,SKILL只需调整提示词。当发现新的错误模式(如"单锚点塌缩"),直接写入SKILL文档,所有后续章节自动获益——无需修改代码逻辑。

2. 可读性:学者能直接阅读和验证方法论。事件年代反思的26条错误模式、12条推理逻辑,用自然语言表达比正则表达式或if-else分支更清晰。史学研究者可以挑战、改进这些规则,而不需要懂编程。

3. 普适性:同一套SKILL架构可直接迁移。《史记》的实体标注SKILL稍作调整即可用于《汉书》《资治通鉴》;年代推断SKILL可复用到任何编年史料。代码往往与具体数据格式强耦合。

4. 可演进性:知识工程本身可以自举。系统从李开元《秦崩》学会30+种史源溯源方法 → 提炼成SKILL → 用这个SKILL分析新案例 → 发现8种新方法 → 更新SKILL。这个闭环用传统代码难以实现。

这套管线的执行,没有人从头写过一行传统程序。每一步对应一份SKILL文档——用结构化自然语言写清楚:输入是什么、处理逻辑是什么、输出是什么、怎么验证。AI读SKILL,执行SKILL,产出结果。

🔍 从数据中涌现的洞见

语法高亮是认知辅助的第一步。更深层的突破是:当实体、事件、关系被结构化后,机器能发现人力不可能完成的模式——跨130篇的矛盾检测、跨越2600年的规律归纳、从57万字中自动推断治乱兴衰的深层逻辑。

知识图谱在构建过程中发现了20+个跨章洞见(详见 eureka.md):

这证明:当知识被充分结构化后,机器辅助的推理能发现人类难以通过线性阅读察觉的深层模式

---

🎨 应用与实验

史记是个巨大的宝库,知识图谱是产生创见的浓缩咖啡。 它能让我们更快、更自动化地创作出更多更好的播客、短视频、小说、电影、游戏。当然,也能帮我们发现历史真相,进行学术研究。

最新好玩的实验(都是刚刚开始的在进行中的半成品):

→ 更多实验见 labs/ 目录

应用场景

详见:史记阅读器重构与语义排版

---

史记 Wiki

在线地址:

《史记》结构化知识的百科式入口——把标注数据、知识图谱、史源分析整合为人可阅读的 wiki 页面网络。

规模(2026-05-14)

| 指标 | 数值 | |------|------| | 总页数 | 20,830+ | | Premium 精品页 | 1,246 | | Featured 精品页 | 686 | | 知识量 K | ~810,000 | | 页面类型 | person / event / story / chapter / place / state / concept / 侯国 / sanwen … 共 15 类 |

页面类型

Butler Agent

wiki 由 butler(自主 AI agent)按轮次维护:每轮执行一个原子操作(新建 stub、深化精品页、引文核验、类型整理),每 23 轮批量提交一次。

agent 配备三层反思机制:

| 反思类型 | 触发条件 | 作用 | |----------|----------|------| | W5 流程反思 | 每 20 条 action | 识别系统性问题,修订操作规则 | | W9 图式反思 | 每完成 6 页(3 精品+3 stub) | 发现页面结构模式,建立类型模板 | | W11 类型审计 | 每 10 轮 | 扫描错误分类,追踪知识量分布 |

详见:wiki/doc/butler-reflections.md — 所有反思记录总览

本地运行

python3 wiki/server/serve.py wiki/public 8000

浏览器打开 http://localhost:8000

---

核心数据

| 类别 | 规模 | 亮点 | |------|------|------| | 文本标注 | 130 篇,57.7 万字 | 22 类实体(18 类名词 + 4 类动词),126,441 次标注 | | 实体 | 14,065 词条 / 126,441 次标注 | 4 轮按章反思,累计修正 ~28,000 处 | | 知识索引 | 18 类名词 + 4 类动词 + 3 类语义关系 | 别名 3,489 条(variants),章内消歧 11,514 处 | | 事件 | 3,198 个,11 类事件类型 | 98.7% 已标注公元纪年 | | 事件关系 | 7,637 条,9 种类型 | 4 种自动计算 + 5 种 LLM 推断,1,876 个跨章换乘 | | 知识单元 | 434 事实 + 241 技能 | 7,497 个实体关联 | | 方法论 | 14 元技能 + 89 管线技能 | 2 本 PDF 合集(共 863 页,2026-03 快照) | | 技术文章 | 1 篇,14 页 PDF | 《从历史书中探索知识图谱》(2026-03-19) |

标注质量里程碑

事件时间反思(5轮Agent迭代,累计修正~2,100处):

实体标注反思(4 轮按章审查,累计修正 ~20,000 处): 其他质量保障 ---

技术架构

四层语义递进模型

结构语义 → 图谱语义 → 知识语义 → 应用语义

每一层回答不同的问题,严格递进:

1. 结构语义(第1层):文本怎么组织的?句子间什么关系?

2. 图谱语义(第2层):谁做了什么?在哪里?什么时候? 3. 知识语义(第3层):怎么分类?遵循什么规律? 4. 应用语义(第4层):历史真相是什么?有哪些矛盾?能发现什么规律? 详见:研究方法总则 | 项目初衷、愿景与未来方向

九步管线(Agent驱动,可并行)

01 校勘 → 02 结构分析 → 03 实体构建
  → [04 事件 / 05 关系 / 06 本体 并行]
  → 07 逻辑推理 → 08 SKU构造 → 09 应用构造
详见:管线总览 | 完整SKILL索引 | 📊 管线调用大图 pipeline.svg

---

路线图

近期:深化《史记》(2026 Q2-Q3)

近期规划:3月完成史记,4月处理汉书和左传,5月完成通鉴。

中期:扩展到26史+资治通鉴(2026-2027)

项目的方法论(管线架构、SKILL文档、Agent工作流)设计之初就考虑了可移植性:

| 目标 | 规模 | 成本估算 | 适配要点 | |------|------|---------|---------| | 二十六史 | ~4,000万字 | 优化后~5-10万元 | 实体类型扩展、朝代特有制度 | | 资治通鉴系列 | ~600-700万字 | 优化后~1-2万元 | 编年体结构、与纪传体互参 | | 先秦诸子 | ~100万字 | 优化后~2千元 | 思想概念为核心实体、论证结构分析 |

关键:不是重复劳动,而是复用已验证的SKILL,让每一部新古籍的处理成本递减

史记一共60万字,处理成本约千元级别(含试错和方法论探索)。优化后,每10万字成本可降至百元级别。

远期:30亿字级古籍数字化基础设施(2028+)

最终愿景:建立一个由AI Agent维护和持续进化的中国古典文献知识网络,让任何人都能以问答、可视化、推理的方式探索数千年的历史智慧。

---

质量保障

为什么会有错误?

这是一个人+AI协作的大规模知识工程项目。57.7 万字、15,331 个实体(18 类名词 + 4 类动词)、3,198 个事件,全部由 AI Agent 在有限提示词指导下自动提取。错误不仅不可避免,而且预期之内

错误的三个主要来源

1. AI理解偏差

2. 标注规范的动态演进 3. 复杂推理的边界

我们怎么修正?

结构化反思循环(Agent-driven Quality Loop)

[AI初始标注] → [规则校验] → [Agent反思] → [批量修正] → [人工抽检] → [规范迭代]
     ↑                                                               ↓
     └─────────────────────── 下一轮反思 ←──────────────────────────┘

实证:事件年代审查的质量收敛

| 轮次 | 修正数 | 涉及章节 | 错误率下降 | |------|--------|---------|-----------| | 第1轮 | 1,010 | 118/130 | 初始基线 | | 第2轮 | 431 | 105/130 | ↓ 57% | | 第3轮 | 465 | 70/130 | ↓ 8% (新类型错误) | | 第4轮 | 167 | 68/130 | ↓ 64% | | 第5轮 | 46 | 28/130 | ↓ 72% |

关键洞察:90%准确率的AI标注 + 5轮反思,总耗时5天,成本约200元。人工从零标注57万字,估计需要6-12个月。速度提升100倍的代价是接受初始错误并系统性迭代修正

多层质量保障机制

1. 自动校验工具链

2. Agent反思审查 3. 人工抽查与规范修订

已知问题清单

详见 Issues,当前主要问题类型:

如何报告错误?

我们非常欢迎社区帮助发现和修正错误!

GitHub Issues:

报告方式:最简单的方式是直接截图上传,配一句话说明问题即可。我们会从截图中定位章节和具体位置。

我们会怎么处理?

1. 48小时内响应:标记issue类型、优先级 2. 批量修正:累积同类错误,用Agent批量修正而非逐个手工改 3. 规范更新:如果是系统性问题,更新SKILL文档并重新运行相关章节 4. 贡献者致谢:在commit message和更新日志中致谢报告者

长期愿景:众包质量迭代

未来计划:

核心理念不追求一次性完美,追求可观测、可迭代的渐进完善。开放数据+开放流程+社区协作,让知识库像开源软件一样持续演化。

---

参与贡献

贡献方式

欢迎各种形式的贡献:

参与指南: resources/help/CONTRIBUTING.md - 详细的贡献流程和规范

GitHub Issues:

社区反馈

2026-03-30: 北京大学考古学生试用反馈 (#85)

在赵冬梅教授的《中国史学史》课堂上,学生们试用了史记知识库并提出了6点建议:

1. ✅ 开关面板 - 已实现语法高亮开关 (#17) 2. 📋 文本版本体系 - 版本信息、注释、异文集成展示 (#87) 3. 📋 图文对照 - 原始典籍页面与数字文本并列展示 (#88) 4. 📋 模糊搜索改进 - 扩展至地名、官职、典故等 (#41) 5. 📋 官制词典 - 辅助理解复杂官制体系 (#89) 6. 📋 问题驱动数据库 - 史料溯源、作者意图分析 (#60)

详细反馈: resources/community/2026-03-30_北大考古学生反馈_issue85.md

这些来自历史学、考古学专业视角的建议,为项目的学术化方向提供了重要指引。

---

快速开始

# 1. 克隆项目
git clone https://github.com/baojie/shiji-kb.git
cd shiji-kb

2. 安装依赖

pip install -r requirements.txt

3. 生成HTML(单章或全部)

python render_shiji_html.py chapter_md/001_五帝本纪.tagged.md python generate_all_chapters.py

4. 查看结果

在线:https://baojie.github.io/shiji-kb

本地:打开 docs/chapters/ 下的HTML文件

目录结构: PROJECT_STRUCTURE.md

---

作者与致谢

创建者

鲍捷 (baojie)

AI协作者

Claude Code (Anthropic)

致谢

许可证

---

免责声明:本项目由AI辅助生成,标注和知识提取中不可避免地存在错误和疏漏。我们正在与AI一起持续修正和完善。本知识库严格局限于《史记》本身的文本内容,不涉及史实考证。

---

项目维护者baojie (上海 / San Jose)· 最后更新:2026-05-14

赞助一杯咖啡

如果你觉得这个项目有意义,欢迎支持我继续做下去。数额随意,不用超过一杯咖啡钱。

https://github.com/baojie/shiji-kb/blob/HEAD/赞助一杯咖啡

GitHub Stars & Activity

3,196Stars
507Forks
50Open issues
HTMLLanguage

GitHub Popularity

GitHub stars3,196
Forks507
Open issues50
Primary languageHTML
License-
Stars gained today124
Created2025-03-12
Last pushed2026-08-31

Trending History

Daily boardrank #36 · ▲ 124 stars

Related GitHub Projects

1

ossu / computer-science

HTML★ 209,209⑂ 25,882▲ 62 stars
2

trycua / cua

HTML★ 24,951⑂ 1,713▲ 1,012 stars
3

affaan-m / ECC

JavaScript★ 263,382⑂ 39,412▲ 1,012 stars
4

tensorflow / tensorflow

C++★ 200,208⑂ 76,964▲ 28 stars
5

Significant-Gravitas / AutoGPT

Python★ 187,458⑂ 46,009▲ 30 stars
6

Genymobile / scrcpy

C★ 150,061⑂ 13,780▲ 78 stars
7

anthropics / claude-code

TypeScript★ 146,951⑂ 23,997▲ 415 stars
8

ggml-org / llama.cpp

C++★ 128,930⑂ 23,486▲ 140 stars

More Trending Repositories