古籍AI智能体系统

扫描件进,可检索、可校对、可出版的文字出 —— 一条完整的古籍文字加工流水线

古籍AI智能体系统界面示意

不是"调一次OCR",是一条流水线

把古籍书页的扫描图片或整本 PDF,自动加工成三版文稿:繁体原文(保留原貌)、简体带标点(现代可读)、拼音注音(诵读辅助),再配上图文对照校对、全文检索与单页导出,直接对接出版流程。

整个过程中,每一次 AI 调用的 Token 消耗与折算费用都逐页、逐文献累计入库 —— 成本可核算、可向客户展示,报价不再拍脑袋。

古籍数字化,卡在哪

01

人工录入慢且贵

一页繁体竖排古籍,熟手录入加校对要 30~60 分钟。一部书几十万字,人工成本动辄数万元,周期按月算。

02

通用OCR不认识古籍

竖排、繁体、异体字、双行夹注、天头批注、药量单位 —— 通用 OCR 错字漏字严重,识别完还得重来一遍。

03

成果没法直接用

识别出来的是一坨无标点文言文,读不懂、搜不了、出不了书,离"数字化"还差十万八千里。

04

AI成本算不清

大模型按 Token 计费,不统计就不知道每本书花了多少钱。接的活越多,心里越没底。

六大核心能力

从上传到出版,每一环都替你想到了

批量录入 · 图片与PDF

批量上传书页图片,或直接扔进整本 PDF —— 系统以 200 DPI 逐页自动渲染并建档,封面自动取第一页。已有文献可追加上传,页码自动续编。

PDFBox200 DPI批量建档

VL视觉模型识别

多模态大模型直接"读图",输出繁体原文并保留原貌。可选图片增强:识别前先放大 1.5~2 倍,古籍小字与批注的识别率明显提升。

多模态大模型图片增强繁体原文

自动标点 + 繁转简

无标点文言文没法读。系统一次调用同时完成"加现代标点"与"繁转简"两项任务 —— 相比拆成两次调用,Token 成本直接减半。

智能断句繁转简成本减半

拼音注音 · 零成本

本地字典查表生成拼音,不占用任何 API 额度。多音字以"字(音1/音2)"标注,校对页渲染成"上字下音",生僻字一眼认出。

本地注音多音字上字下音

图文对照校对

左侧原图、右侧识别文字,逐页翻页对照。三版文字分 Tab 独立编辑,保存后自动流转"已校对/已修改"状态,支持按校对进度筛选。

左图右文三版文字校对留痕

检索 · 调序 · 导出

全文检索命中关键词上下文片段,一键预览该页图文;书页支持拖拽调序(区间平移,绝不跳号);任意页可导出 A4 PDF,上图下文,直接送审送印。

全文检索书页调序单页PDF

识别率高,是踩坑换来的

这些细节,只有真做过整本古籍的人才知道

提示词专为古籍调优

通用提示词对双行夹注、小字批注、药量单位漏字严重。我们明确点名"小字注释、批注、剂量数字"后,漏字率显著下降 —— 这是实战踩坑换来的经验。

两步合成一次调用

"加标点"与"繁转简"合并为一次请求,Token 成本减半且上下文一致,质量无损。温度参数固定 0.1:文字加工要的是忠实,不是创造。

批量识别 · 可中断

整本几百页逐页点不现实。线程池限流提交即返回,前端实时看到"第 x/共 y 页"与预计剩余时间,随时中止;单页失败只记失败数,不拖垮整本。

双AI平台一键切换

内置阿里云百炼与 Agnes AI 两套配置,同为 OpenAI 兼容协议,后台切换零改码。单价按模型、按平台隔离,免费额度不会被默认价格覆盖。

每页花了多少钱,清清楚楚

古籍加工是按页走量的生意,成本必须可核算

纯人工录入

⏱ 30~60 分钟 / 页

💰 按字数计酬,整本数万元

📅 周期按月计算

🔁 返工成本高

📊 成本难量化到页

深度古籍AI

⏱ 1~3 分钟 / 页

💰 仅模型 Token 费用

📅 整本批量过,进度可视

🔁 失败页一键重跑

📊 逐页 Token 与费用可导出

每次 AI 调用后,系统自动提取本次输入/输出 Token,按模型单价折算费用,写入书页记录并汇总到文献总账。后台 Token 统计页可按文献查看明细并导出 —— 成本核算、对外报价,都用真实数据说话。

客户自己的服务器,开箱即用

01

单机即可运行

Java 8 + Spring Boot 2.7 + MySQL 5.7,打成 war 包丢进 Tomcat 9 就能跑。客户电脑上装个 Tomcat 即可,简单直接。

02

不堆中间件

刻意不依赖 Redis、不依赖消息队列、不依赖 Elasticsearch —— 所有异步进度放在 JVM 内存,少一台中间件就少一堆运维麻烦。

03

配置改完即生效

AI 平台、API 地址、Key、模型名、单价、OCR 提示词、图片增强倍数 —— 全部后台可视化维护,保存立即生效,不用重启、不用改配置文件。

04

接线自检 + 安全兜底

内置 API 连接测试按钮,配错了当场发现;后台登录拦截、参数化查询防注入、全局异常统一兜底,应用关闭时自动释放线程池,避免线程泄漏。

谁在用这套系统

01

图书馆 / 档案馆

馆藏古籍批量数字化,建成可检索的全文数据库,读者检索关键词直达原页图文。

02

出版社 / 古籍整理

点校工作前置,AI 出初稿、编辑做精校,出版周期大幅压缩。

03

中医与医书整理

药方、药量单位专项优化识别,双行夹注不丢失,适合医籍与方书数字化。

04

地方志 / 文旅

县志、族谱、碑刻拓片数字化,把沉睡的地方文献变成可运营的文化资产。

有古籍要数字化

带上几页样张联系我们,我们先跑一遍真实识别,用效果说话 —— 满意再谈合作。

18660898711