迈向高效的古汉语翻译:数据集、模型与评估
计算与语言
2023-08-02 v1
摘要
解读古汉语是理解浩瀚中国文学、传统与文明的关键。本文提出用于古汉语翻译的 Erya。从数据集角度,我们从多种来源收集、清洗并分类古汉语材料,形成了迄今最广泛的古汉语资源。从模型角度,我们设计了面向古汉语的 Erya 训练方法。我们设计两个协同工作的任务:双音节对齐替换(DAS)与双重掩码语言模型(DMLM)。从评估角度,我们构建了一个基准以判断不同场景下古汉语翻译质量,并评估了各类现有模型的古汉语翻译能力。我们的模型在五个领域展现出卓越的零样本性能,相较 GPT-3.5 模型提升超过 +12.0 BLEU,且人工评估结果优于 ERNIE Bot。后续微调进一步显示出 Erya 模型优越的迁移能力,带来 +6.2 BLEU 增益。我们在 https://github.com/RUCAIBox/Erya 发布了上述所有资源。
引用
@article{arxiv.2308.00240,
title = {Towards Effective Ancient Chinese Translation: Dataset, Model, and Evaluation},
author = {Geyang Guo and Jiarong Yang and Fengyuan Lu and Jiaxin Qin and Tianyi Tang and Wayne Xin Zhao},
journal= {arXiv preprint arXiv:2308.00240},
year = {2023}
}
备注
Accepted by NLPCC 2023