引言
甲骨文是商王朝留下的文字遗存,目前出土的甲骨碎片超过 15 万片,包含约 4500 个不同字形,但得到较可靠释读的只有约 1500 个,余下约 3000 余字仍是悬而未决的难题。传统释读依赖专家翻检拓片、比对青铜器铭文、战国文字和小篆字形,再回到古籍与现代论文中寻找用例,过程漫长且高度依赖个人经验。近期,来自华中科技大学等机构的联合团队在《The Innovation》发表了首个模拟专家释读流程的人工智能系统 AlphaOracle,尝试将这套依赖个人经验的考释工作流,部分转化为可复核、可重复、可协作的计算框架。本文基于已公开的论文与官方报道,对其技术原理、专家评估、影响与局限进行解读。
一、研究背景:为什么需要"模拟专家流程"的古文字 AI
1.1 甲骨文释读的固有难题
甲骨文释读之所以困难,主要源于三方面因素:
- 字形历史层叠:一个字往往跨越甲骨文、金文、战国文字、小篆、隶书等多个阶段,形体演变路径复杂。
- 载体残缺:骨片断裂、刻辞残缺、笔画缺失等问题普遍存在,许多字无法仅凭孤立字形判定。
- 证据分散:参考语料分布于《甲骨文合集》《甲骨文校释总集》等不同数据库,以及《说文解字》《古文字诂林》等传世典籍与大量现代研究论文中,跨年代、跨载体、跨数据库的检索消耗大量时间。
1.2 既有 AI 方法的不足
来源材料指出,以往的古文字 AI 工作通常依据孤立字形预测对应的现代汉字,主要依赖视觉信息,很少结合文本语境与传世文献做交叉佐证。因此其输出虽然在字形层面看似合理,却缺少语言学与史料层面的论证,能够给予专家的帮助十分有限。这是 AlphaOracle 团队明确想要解决的核心痛点。
二、技术原理:AlphaOracle 的四步工作流
AlphaOracle 的核心思路是模拟专家的真实考释流程,把每一步推理都拆成独立模块,每个模块既可以单独评估,也保留可追溯的证据来源。整套流程由四步串联:
2.1 第一步:拓片解析
输入一张原始拓片后,系统依次完成:
- 字符检测:定位每个甲骨文字符;
- 字符分类:通过分类器辨认已释字,把仍存争议的未释字交给后续模块;
- 阅读顺序重建:以字符为节点构建图神经网络(GNN),结合空间信息判断句子的起点、终点和字符之间的连接关系,恢复阅读顺序。
最终将拓片拆分为若干带阅读顺序、具备初步识别结果的独立语句。
2.2 第二步:形态分析
系统从历时演变与内部结构两个方向为未释字提出多个破译假设,由三个子网络并行:
- 字形演变网络:利用扩散模型模拟古代字形向后世形体的变化,对多次生成结果进行识别与汇总;
- 部件演变网络:拆解甲骨字形中的构件,并映射为汉字的表意描述序列(IDS),根据部件组合推测对应汉字;
- 历史时期演变网络:把甲骨文、金文、战国文字、小篆和隶书放在同一条时间线上比较相似程度。
三个子模型各自给出候选及概率,系统按可信度加权,综合判断该字是否已有公认释读,并为未释字保留多个候选答案与相应置信度。
2.3 第三步:语境对齐
形态分析给出的候选还需放回语句上下文检验:
- 系统先从《甲骨文合集》《甲骨文摹本大系》《甲骨文校释总集》等数字化资料中,依据图像与文本信息检索目标字符的全部已知用例;
- 再用面向甲骨文训练的掩码语言模型分析前后搭配:训练时根据已知上下文补回被遮住的字,推理时一方面重新排序形态模块的候选,另一方面独立提出语义候选;
- 该步骤还包含一个解释模型,经过监督微调与基于反馈的强化学习,汇总同一字在不同卜辞中的用法,并生成便于研究者核查的现代汉语说明。
2.4 第四步:文献佐证
经过字形与语境筛选的候选,最后进入文献核验:
- 资料覆盖 25 部古代传世文献与 23,755 篇权威现代研究,包括《说文解字》、先秦两汉典籍,以及《古文字诂林》《甲骨文诂林》《甲骨文字林》等专业著作;
- 检索时同时纳入异体字与近义词,并从文字语义与字形图像两条路径寻找相关材料;
- 不同文献的相关程度、权威性、文献类型与时代早晚都会影响证据权重,每条材料均保留书目信息与检索理由,便于研究者追查原文。
最终生成的综合报告依次呈现字形依据、语境用例与文献证据,给出当前支持度最高的读法与置信度,同时明确保留尚未解决的分歧。
关键设计理念:AlphaOracle 不替代专家做最终判断,而是把每一步推理所需的证据收集与初步整理自动化,让研究者专注于证据的甄别与最终裁决。
三、实验结果与专家评估
甲骨文释读缺少公认的统一基准,因此论文把大问题拆成若干可测任务,并从组件性能与专家使用价值两方面进行评估。
3.1 组件级实验
| 任务 | 指标 | AlphaOracle | 备注 |
|---|---|---|---|
| 模拟未释字识别 | Top-1 准确率 | 23.1% | 测试集为 88 个训练阶段从未出现的已知字类 |
| 残缺卜辞恢复 | 准确率 | 56.1% | 基线最佳通用大模型为 22.2% |
| 从字形候选中筛选上下文最合适者 | 准确率 | 95.2% | 基线最佳通用大模型为 65.4% |
| 现代汉语释义(代理任务) | BLEU / ROUGE / METEOR | 0.491 / 0.586 / 0.659 | — |
重要提示:上述通用大模型(GPT-5、Gemini 2.5 Pro、DeepSeek)采用的是零样本设置,未接受甲骨文领域数据微调。该对比旨在说明专门语料与领域化流程对该任务的重要性,而非通用模型的真实能力上限。
3.2 专家使用评估
86 名来自甲骨文、人工智能及相关领域的专家和博士研究者匿名参与了系统评估:
- 78.7% 的参与者认为系统"有帮助"或"非常有帮助";
- 参与者估计平均可节省约 64% 的分析时间(自报数据,非实测);
- 模块化评分(满分 5 分):拓片解析 4.20、字形分析 4.44、语境对齐 4.38、文献依据检索 4.01;
- 文献检索环节:随机抽取 42 个甲骨文字进行人工检查,命中率 90.2%,准确率 74.8%。
3.3 "人类竞技场"盲测
论文还组织了 210 次盲测,由来自故宫博物馆、上海博物馆、中国社会科学院、清华大学、复旦大学、南京大学、吉林大学、郑州大学、河南大学、河南师范大学、首都师范大学、西南大学、中国海洋大学、甲骨文信息处理教育部重点实验室,以及韩国、日本、美国相关学术团体的资深甲骨学者参与:
| 系统 | 偏好率 |
|---|---|
| AlphaOracle | 45.2% |
| DeepSeek | 34.8% |
| Gemini 2.5 Pro | 12.9% |
| GPT-5 | 7.1% |
3.4 疑难字案例
- 论文报告了对"屯南 307"拓片中长期争议字的释读,综合字形、辞例与文献材料,将其解释为**"勞"的异体字**,为其作为地名或族名的解释补充了证据。
- 还报告了 22 个有争议异体字的消歧结果,部分分析已进入甲骨文权威学术数据库。
四、影响与意义
- 工作流层面的范式转变:把分散、依赖个人经验的古文字考释流程,部分转化为可复核、可重复、可协作的计算框架;
- 证据链可追溯:每个候选结果和证据来源都被完整保留,最终汇总成"可溯源、可核查的辅助考释报告",便于专家逐项检验与讨论;
- 跨领域迁移潜力:论文总结中提到,这种思路"同样可以延伸到其他古文字领域",为金文、战国文字、简帛文字等建立更系统的 AI 辅助整理框架提供了参考路径;
- 人机协同的研究图景:机器负责从海量材料中迅速提出假设、完成检索与比对,学者负责辨别证据轻重、把握最终决策。
五、限制与注意事项
依据来源材料披露的信息,目前 AlphaOracle 至少存在以下几方面的限制,使用者应保持审慎:
- 文献检索的"高命中率 ≠ 高准确率":来源明确指出,文献检索环节的命中率为 90.2%,但准确率仅为 74.8%,意味着系统会把大部分有价值的材料呈现出来,但其中仍会夹杂需要专家排除的文献资料;
- 评估多为自报与代理任务:专家评估中"节省 64% 时间"为参与者估计值,并非实测;现代汉语释义任务使用的是代理评测指标(BLEU/ROUGE/METEOR),不等同于真实考释质量;
- 缺乏公认基准:甲骨文释读本身缺少统一的评测基准,论文通过"模拟未释字"等方式构建测试集,但仍无法完全替代真实未释字的考释难度;
- 通用模型基线偏低:论文中的 GPT-5、Gemini 2.5 Pro、DeepSeek 采用零样本设置,未接受领域微调,因此对比结果不能直接外推到这些模型在微调后的能力;
- 最终判断仍依赖专家:来源多次强调系统"只做少量必要的判断,但并不替代专家作出最终判断",这一点在使用时不应被忽视。
推断说明:以上第 4 点属于对来源材料的延伸解读,原始论文的对比设置本身并不意味着通用大模型在甲骨文任务上的真实能力上限止步于此。
六、实践建议
针对可能使用该系统或受其启发开展工作的研究者与开发者,提出以下建议:
6.1 给古文字研究者
- 把它当作"证据整理助手"而非"答案生成器":优先利用系统的检索与汇总能力,把节省出的时间用于证据甄别与学术判断;
- 逐条复核文献来源:由于文献检索准确率约 74.8%,对系统呈现的材料仍需追溯原文核实;
- 关注多证据一致性:对系统给出的高置信度结论,建议同时核对字形依据、辞例用例与文献佐证三方面是否一致。
6.2 给 AI 开发者
- 领域化语料与流程至关重要:从对比数据看,专门语料与领域化流程相较零样本通用模型有显著优势,这提示后续工作应继续投入高质量甲骨文标注语料;
- 可解释性优先于端到端答案:来源指出"机器不该只是端到端地、没有依据地给出一个最终答案",可溯源的证据链是这类专业领域系统的关键;
- 构建公认的评测基准:甲骨文释读领域亟需统一基准,以推动后续方法的可比性。
结语
AlphaOracle 的价值不在于"替代专家破译甲骨文",而在于把专家考释流程中繁琐的材料检索与初步整理工作自动化、可追溯化,从而让研究者把更多精力投入到学术判断本身。其设计思路——不追求端到端答案,而是把每一步推理所需证据显式化——对其他古文字领域的 AI 辅助研究同样具有借鉴意义。古文字研究终究离不开人的判断,机器拓展材料搜索的广度,人的学识守住学术判断的深度,二者协同才有可能让更多沉睡三千年的文字重新被看见。