基于共性与多样性建模的无监督神经方言翻译
计算与语言
2022-10-20 v1
摘要
作为一种特殊的机器翻译任务,方言翻译有两个主要特征:1) 缺乏平行训练语料;2) 翻译双方之间拥有相似的语法。在本文中,我们研究如何利用方言之间的共性与多样性,从而仅借助单语数据构建无监督翻译模型。具体而言,我们利用枢轴-私有嵌入、层协调以及参数共享,从词汇、句法到语义层面充分建模源语言与目标语言之间的共性与多样性。为了检验所提模型的有效性,我们为普通话和粤语各收集了 2000 万单语语料,二者分别是中国的官方语言和最常用的方言。实验结果表明,我们的方法在 BLEU 分数上超过基于规则的简繁中文转换和传统的无监督翻译模型 12 分以上。
引用
@article{arxiv.1912.05134,
title = {Unsupervised Neural Dialect Translation with Commonality and Diversity Modeling},
author = {Yu Wan and Baosong Yang and Derek F. Wong and Lidia S. Chao and Haihua Du and Ben C. H. Ao},
journal= {arXiv preprint arXiv:1912.05134},
year = {2022}
}
备注
AAAI 2020