理解与增强上下文在机器翻译中的使用
计算与语言
2021-02-23 v1
摘要
为了理解和推断语言中的含义,神经模型必须学习复杂的细微差别。从数据中发掘独特的语言现象并非易事。例如,词汇歧义是语言的基本特征,难以学习。更为突出的是,用神经网络推断罕见和未见过词汇单元的含义是困难的。含义通常由上下文决定。借助上下文,即使读者不认识所使用的特定词语,语言也能传达含义。为了对这种学习过程建模,系统必须从上下文中的少量实例学习,并能够很好地泛化到未见过的情况。当某项任务的训练数据稀缺时,学习过程会受到阻碍。即使数据充足,学习词汇分布长尾的模式也具有挑战性。在本论文中,我们专注于理解神经模型中上下文的某些潜力,并设计增强模型以从中受益。我们关注机器翻译这一更一般语言理解问题的重要实例。要从源语言翻译到目标语言,神经模型必须理解所提供上下文中组成部分的含义,并在目标语言中生成具有相同含义的组成部分。该任务凸显了捕捉语言细微差别的价值以及从少量观察中泛化的必要性。本论文研究的主要问题是神经机器翻译模型从数据中学习到了什么,以及我们如何设计更有针对性的上下文来增强这种学习。更深入地审视上下文的作用以及数据对学习模型的影响,对于推进 NLP 领域至关重要。此外,它有助于凸显当前神经网络的脆弱性,并为设计更鲁棒的模型提供见解。
引用
@article{arxiv.2102.10437,
title = {Understanding and Enhancing the Use of Context for Machine Translation},
author = {Marzieh Fadaee},
journal= {arXiv preprint arXiv:2102.10437},
year = {2021}
}
备注
PhD dissertation defended on November 10th, 2020