中文

基于有限对齐语料库的古文与现代汉语自动互译

计算与语言 2022-10-14 v4

摘要

汉语在长期发展过程中经历了巨大演变。因此,以汉语为母语者如今阅读古文句子存在困难。本文提出构建一个端到端神经模型,实现古文与现代汉语的自动互译。然而,现有古今汉语平行语料未在句级对齐且句对齐语料有限,导致模型训练困难。为构建模型的句级平行训练数据,我们提出一种无监督算法,利用对齐句对共享大量词符的事实来构造句对齐的古今汉语对。基于对齐语料,我们提出一种带复制机制和局部注意力的端到端神经模型用于古今汉语互译。实验显示,所提无监督算法的句对齐F1值达99.4%,翻译模型在古译今上取得26.95 BLEU,在今译古上取得36.34 BLEU。

关键词

引用

@article{arxiv.1803.01557,
  title  = {Automatic Translating between Ancient Chinese and Contemporary Chinese with Limited Aligned Corpora},
  author = {Zhiyuan Zhang and Wei Li and Qi Su},
  journal= {arXiv preprint arXiv:1803.01557},
  year   = {2022}
}

备注

Accepted by NLPCC 2019