面向跨语言任务定制的“维基式”监督神经翻译
计算与语言
2021-09-13 v2 计算机视觉与模式识别
摘要
我们提出一种简单而有效的方法,利用维基百科进行神经机器翻译以及图像描述与依存句法分析的跨语言任务,无需使用来自外部平行数据或目标语言中监督模型的任何直接监督。我们表明,链接维基百科页面的首句与标题,以及跨语言图像描述,是提取双语词典与跨语言词嵌入以从维基百科挖掘平行文本的强信号种子平行数据。我们的最终模型在低资源语言中取得了接近或有时高于强监督基线的BLEU分数;例如,英语到哈萨克语中监督BLEU为4.0,而我们的模型为12.1。此外,我们将维基式监督翻译模型定制用于无监督图像描述与跨语言依存句法分析器迁移。在图像描述中,我们为阿拉伯语和英语训练了一个多任务机器翻译与图像描述流水线,其中阿拉伯语训练数据是使用我们的维基式监督翻译模型翻译的英语描述数据。我们在阿拉伯语上的描述结果略优于其监督模型。在依存句法分析中,我们翻译大量单语文本,并在标注投影框架中将其用作人工训练数据。我们表明我们的模型优于近期跨语言依存句法分析器迁移的工作。
引用
@article{arxiv.2104.08384,
title = {"Wikily" Supervised Neural Translation Tailored to Cross-Lingual Tasks},
author = {Mohammad Sadegh Rasooli and Chris Callison-Burch and Derry Tanti Wijaya},
journal= {arXiv preprint arXiv:2104.08384},
year = {2021}
}
备注
To appear in EMNLP 2021 main conference