中文

Kanbun-LM:基于语言模型的汉文日文训读法与翻译

计算与语言 2024-07-03 v2

摘要

自然语言处理(NLP)的近期研究聚焦于现代语言,并在许多任务上取得了最先进的结果。与此同时,对古代文本及相关任务的关注甚少。古典中文约在2000年前传入日本,逐渐适应为称为汉文训读(Kanbun)的日本式读写与翻译方法,对日本文学产生了重大影响。然而,与大陆中国丰富的古代文本资源相比,日本的Kanbun资源仍然稀缺。为解决此问题,我们构建了世界上首个古典中文到Kanbun的数据集。此外,我们引入了字符重排序和机器翻译两项任务,二者在Kanbun理解中均发挥重要作用。我们还在这些任务上测试了当前语言模型,并通过将结果与人类评分比较来探讨最佳评估方法。我们在GitHub上发布了代码与数据集。

关键词

引用

@article{arxiv.2305.12759,
  title  = {Kanbun-LM: Reading and Translating Classical Chinese in Japanese Methods by Language Models},
  author = {Hao Wang and Hirofumi Shimizu and Daisuke Kawahara},
  journal= {arXiv preprint arXiv:2305.12759},
  year   = {2024}
}

备注

Findings of ACL 2023