面向开放词表神经机器翻译的潜在形态模型
计算与语言
2020-02-28 v3
摘要
翻译为形态丰富语言时,极稀疏的词表对神经机器翻译(NMT)模型构成挑战,其中对表层形式的原子化处理并不现实。该问题通常通过以下两种方式解决:将词预处理为子词单元,或直接在字符层面进行翻译。前者基于利用语料级统计优化的分词算法,而不考虑翻译任务;后者直接从翻译数据中学习,但需要相当深的架构。在本文中,我们提出通过层次化潜变量模型对词的形成进行建模来翻译词,该模型模拟形态屈折的过程。我们的模型通过组合两种潜表示逐字符生成词:一种连续的表示,旨在捕捉词汇语义;以及一组(近似)离散特征,旨在捕捉形态句法功能,并在不同表层形式间共享。我们的模型在翻译为三种形态丰富语言时比常规的开放词表 NMT 方法取得更好的准确率,同时在低资源到中资源设定下也展现出更好的泛化能力。
引用
@article{arxiv.1910.13890,
title = {A Latent Morphology Model for Open-Vocabulary Neural Machine Translation},
author = {Duygu Ataman and Wilker Aziz and Alexandra Birch},
journal= {arXiv preprint arXiv:1910.13890},
year = {2020}
}
备注
Published at ICLR 2020