中文

面向低资源神经机器翻译场景的基于规则的机器翻译模型中的术语与命名实体知识应用

计算与语言 2020-09-29 v1

摘要

基于规则的机器翻译是一种机器翻译范式,其中语言知识由专家以规则的形式编码,用于将文本从源语言翻译到目标语言。虽然这种方法对系统输出具有广泛的控制能力,但形式化所需语言知识的成本远高于基于语料的系统,后者使用机器学习方法从示例中自动学习翻译。在本文中,我们描述了利用基于规则的机器翻译系统中所含信息来改进基于语料的系统(即神经机器翻译模型)的不同方法,重点关注低资源场景。使用了三种不同类型的信息:形态信息、命名实体和术语。除了评估系统的总体性能外,我们还系统地分析了所提出方法在处理目标现象时的表现。我们的结果表明,所提出的模型从外部信息中学习的能力有限,且大多数方法并未显著改变自动评估的结果,但我们的初步定性评估显示,在某些情况下,我们系统生成的假设表现出有利的行为,例如保持被动语态的使用。

关键词

引用

@article{arxiv.2009.13398,
  title  = {Aspects of Terminological and Named Entity Knowledge within Rule-Based Machine Translation Models for Under-Resourced Neural Machine Translation Scenarios},
  author = {Daniel Torregrosa and Nivranshu Pasricha and Maraim Masoud and Bharathi Raja Chakravarthi and Juan Alonso and Noe Casas and Mihael Arcan},
  journal= {arXiv preprint arXiv:2009.13398},
  year   = {2020}
}