中文

共享遗产,独特书写:重新思考东亚历史文献的资源选择

计算与语言 2026-03-24 v2

摘要

东亚汉文化圈的历史文献以其共同的格式和实践而闻名,尤其是由宫廷史官编纂的实录。这种共享的语言遗产使得研究者在处理韩国和日本的历史文献时,利用文言文资源进行跨语言迁移,因为这些文献的资源相对匮乏。在本文中,我们质疑了从文言文到韩文汉字和汉文的跨语言可迁移性假设,这两种语言分别是韩国和日本古代书面语。我们在机器翻译、命名实体识别和标点恢复任务上的实验表明,文言文数据集对韩文汉字书写的古代韩国文献的语言模型性能影响极小,序列标注任务的性能差异在±0.0068 F1-score以内,翻译任务最高可达+0.84 BLEU分数。这些局限性在不同的模型规模、架构和领域特定数据集上始终一致。我们的分析表明,随着韩文汉字本地语言数据的增加,文言文资源的益处迅速减少,而只有在极低资源场景下,韩语和日语历史文献才能获得显著提升。这些发现强调需要仔细的实证验证,而非假定无差别的跨语言迁移能带来好处。

关键词

引用

@article{arxiv.2411.04822,
  title  = {Shared Heritage, Distinct Writing: Rethinking Resource Selection for East Asian Historical Documents},
  author = {Seyoung Song and Haneul Yoo and Jiho Jin and Kyunghyun Cho and Alice Oh},
  journal= {arXiv preprint arXiv:2411.04822},
  year   = {2026}
}

备注

IJCNLP-AACL 2025 Findings