Kanbun-LM:基于语言模型的汉文日文训读法与翻译
计算与语言
2024-07-03 v2
摘要
自然语言处理(NLP)的近期研究聚焦于现代语言,并在许多任务上取得了最先进的结果。与此同时,对古代文本及相关任务的关注甚少。古典中文约在2000年前传入日本,逐渐适应为称为汉文训读(Kanbun)的日本式读写与翻译方法,对日本文学产生了重大影响。然而,与大陆中国丰富的古代文本资源相比,日本的Kanbun资源仍然稀缺。为解决此问题,我们构建了世界上首个古典中文到Kanbun的数据集。此外,我们引入了字符重排序和机器翻译两项任务,二者在Kanbun理解中均发挥重要作用。我们还在这些任务上测试了当前语言模型,并通过将结果与人类评分比较来探讨最佳评估方法。我们在GitHub上发布了代码与数据集。
引用
@article{arxiv.2305.12759,
title = {Kanbun-LM: Reading and Translating Classical Chinese in Japanese Methods by Language Models},
author = {Hao Wang and Hirofumi Shimizu and Daisuke Kawahara},
journal= {arXiv preprint arXiv:2305.12759},
year = {2024}
}
备注
Findings of ACL 2023