AlphaOracle:首个模拟专家工作流的甲骨文辅助释读系统解读

AI 前沿AlphaOracleopenstarry.com

引言

甲骨文是商王朝留下的文字遗存,目前出土的甲骨碎片超过 15 万片,包含约 4500 个不同字形,但得到较可靠释读的只有约 1500 个,余下约 3000 余字仍是悬而未决的难题。传统释读依赖专家翻检拓片、比对青铜器铭文、战国文字和小篆字形,再回到古籍与现代论文中寻找用例,过程漫长且高度依赖个人经验。近期,来自华中科技大学等机构的联合团队在《The Innovation》发表了首个模拟专家释读流程的人工智能系统 AlphaOracle,尝试将这套依赖个人经验的考释工作流,部分转化为可复核、可重复、可协作的计算框架。本文基于已公开的论文与官方报道,对其技术原理、专家评估、影响与局限进行解读。


一、研究背景:为什么需要"模拟专家流程"的古文字 AI

1.1 甲骨文释读的固有难题

甲骨文释读之所以困难,主要源于三方面因素:

1.2 既有 AI 方法的不足

来源材料指出,以往的古文字 AI 工作通常依据孤立字形预测对应的现代汉字,主要依赖视觉信息,很少结合文本语境与传世文献做交叉佐证。因此其输出虽然在字形层面看似合理,却缺少语言学与史料层面的论证,能够给予专家的帮助十分有限。这是 AlphaOracle 团队明确想要解决的核心痛点。


二、技术原理:AlphaOracle 的四步工作流

AlphaOracle 的核心思路是模拟专家的真实考释流程,把每一步推理都拆成独立模块,每个模块既可以单独评估,也保留可追溯的证据来源。整套流程由四步串联:

2.1 第一步:拓片解析

输入一张原始拓片后,系统依次完成:

  1. 字符检测:定位每个甲骨文字符;
  2. 字符分类:通过分类器辨认已释字,把仍存争议的未释字交给后续模块;
  3. 阅读顺序重建:以字符为节点构建图神经网络(GNN),结合空间信息判断句子的起点、终点和字符之间的连接关系,恢复阅读顺序。

最终将拓片拆分为若干带阅读顺序、具备初步识别结果的独立语句。

2.2 第二步:形态分析

系统从历时演变内部结构两个方向为未释字提出多个破译假设,由三个子网络并行:

三个子模型各自给出候选及概率,系统按可信度加权,综合判断该字是否已有公认释读,并为未释字保留多个候选答案与相应置信度。

2.3 第三步:语境对齐

形态分析给出的候选还需放回语句上下文检验:

2.4 第四步:文献佐证

经过字形与语境筛选的候选,最后进入文献核验:

最终生成的综合报告依次呈现字形依据、语境用例与文献证据,给出当前支持度最高的读法与置信度,同时明确保留尚未解决的分歧。

关键设计理念:AlphaOracle 不替代专家做最终判断,而是把每一步推理所需的证据收集与初步整理自动化,让研究者专注于证据的甄别与最终裁决。


三、实验结果与专家评估

甲骨文释读缺少公认的统一基准,因此论文把大问题拆成若干可测任务,并从组件性能专家使用价值两方面进行评估。

3.1 组件级实验

任务 指标 AlphaOracle 备注
模拟未释字识别 Top-1 准确率 23.1% 测试集为 88 个训练阶段从未出现的已知字类
残缺卜辞恢复 准确率 56.1% 基线最佳通用大模型为 22.2%
从字形候选中筛选上下文最合适者 准确率 95.2% 基线最佳通用大模型为 65.4%
现代汉语释义(代理任务) BLEU / ROUGE / METEOR 0.491 / 0.586 / 0.659

重要提示:上述通用大模型(GPT-5、Gemini 2.5 Pro、DeepSeek)采用的是零样本设置,未接受甲骨文领域数据微调。该对比旨在说明专门语料与领域化流程对该任务的重要性,而非通用模型的真实能力上限。

3.2 专家使用评估

86 名来自甲骨文、人工智能及相关领域的专家和博士研究者匿名参与了系统评估:

3.3 "人类竞技场"盲测

论文还组织了 210 次盲测,由来自故宫博物馆、上海博物馆、中国社会科学院、清华大学、复旦大学、南京大学、吉林大学、郑州大学、河南大学、河南师范大学、首都师范大学、西南大学、中国海洋大学、甲骨文信息处理教育部重点实验室,以及韩国、日本、美国相关学术团体的资深甲骨学者参与:

系统 偏好率
AlphaOracle 45.2%
DeepSeek 34.8%
Gemini 2.5 Pro 12.9%
GPT-5 7.1%

3.4 疑难字案例


四、影响与意义

  1. 工作流层面的范式转变:把分散、依赖个人经验的古文字考释流程,部分转化为可复核、可重复、可协作的计算框架;
  2. 证据链可追溯:每个候选结果和证据来源都被完整保留,最终汇总成"可溯源、可核查的辅助考释报告",便于专家逐项检验与讨论;
  3. 跨领域迁移潜力:论文总结中提到,这种思路"同样可以延伸到其他古文字领域",为金文、战国文字、简帛文字等建立更系统的 AI 辅助整理框架提供了参考路径;
  4. 人机协同的研究图景:机器负责从海量材料中迅速提出假设、完成检索与比对,学者负责辨别证据轻重、把握最终决策。

五、限制与注意事项

依据来源材料披露的信息,目前 AlphaOracle 至少存在以下几方面的限制,使用者应保持审慎:

  1. 文献检索的"高命中率 ≠ 高准确率":来源明确指出,文献检索环节的命中率为 90.2%,但准确率仅为 74.8%,意味着系统会把大部分有价值的材料呈现出来,但其中仍会夹杂需要专家排除的文献资料
  2. 评估多为自报与代理任务:专家评估中"节省 64% 时间"为参与者估计值,并非实测;现代汉语释义任务使用的是代理评测指标(BLEU/ROUGE/METEOR),不等同于真实考释质量;
  3. 缺乏公认基准:甲骨文释读本身缺少统一的评测基准,论文通过"模拟未释字"等方式构建测试集,但仍无法完全替代真实未释字的考释难度
  4. 通用模型基线偏低:论文中的 GPT-5、Gemini 2.5 Pro、DeepSeek 采用零样本设置,未接受领域微调,因此对比结果不能直接外推到这些模型在微调后的能力
  5. 最终判断仍依赖专家:来源多次强调系统"只做少量必要的判断,但并不替代专家作出最终判断",这一点在使用时不应被忽视。

推断说明:以上第 4 点属于对来源材料的延伸解读,原始论文的对比设置本身并不意味着通用大模型在甲骨文任务上的真实能力上限止步于此。


六、实践建议

针对可能使用该系统或受其启发开展工作的研究者与开发者,提出以下建议:

6.1 给古文字研究者

6.2 给 AI 开发者


结语

AlphaOracle 的价值不在于"替代专家破译甲骨文",而在于把专家考释流程中繁琐的材料检索与初步整理工作自动化、可追溯化,从而让研究者把更多精力投入到学术判断本身。其设计思路——不追求端到端答案,而是把每一步推理所需证据显式化——对其他古文字领域的 AI 辅助研究同样具有借鉴意义。古文字研究终究离不开人的判断,机器拓展材料搜索的广度,人的学识守住学术判断的深度,二者协同才有可能让更多沉睡三千年的文字重新被看见。

以 AI 之力,筑未来之境

现在注册,立即免费获赠 200 次大模型调用权益

免费注册 →