InteChar:面向古汉语语言建模的统一祖骨字符表
计算与语言
2025-08-25 v1 人工智能
摘要
构建历史语言模型(LM)在帮助考古学 provenance 研究和理解古代文化方面发挥着关键作用。然而,现有资源为训练高效的历史文本 LM 带来了诸多挑战。首先,历史语言样本稀缺,使得基于大规模文本语料的无监督学习方法效率极低,阻碍了有效的预训练。其次,由于古代脚本的时间差距巨大且演化复杂,缺乏完整的字符编码方案,限制了古代文本的数字化和计算处理,尤其是在早期汉字书写方面。为此,本文引入 InteChar——一个统一且可扩展的字符表,将未编码的祖骨字符与传统汉字及现代汉字整合在一起。InteChar 实现了历史文本的一致性数字化与表征,为古代脚本的稳健建模提供了基础。为评估 InteChar 的有效性,我们构建了 Oracle Corpus Set(OracleCS),这是一套以专家标注样本为中心,结合 LLM 辅助数据增强的古汉语语料库,聚焦于祖骨铭文。广泛的实验表明,使用 InteChar 在 OracleCS 上训练的模型在各种历史语言理解任务上均实现了显著提升,确认了本方法的有效性,并为未来的古汉语 NLP 研究奠定了坚实基础。
引用
@article{arxiv.2508.15791,
title = {InteChar: A Unified Oracle Bone Character List for Ancient Chinese Language Modeling},
author = {Xiaolei Diao and Zhihan Zhou and Lida Shi and Ting Wang and Ruihua Qi and Hao Xu and Daqian Shi},
journal= {arXiv preprint arXiv:2508.15791},
year = {2025}
}