自监督神经机器翻译中的自诱导课程学习
计算与语言
2020-10-07 v2
摘要
自监督神经机器翻译(SSNMT)联合学习从可比语料(而非平行语料)中识别并筛选合适训练数据以及进行翻译,使得两项任务在良性循环中相互支撑。本研究对 SSNMT 模型在训练过程中所做的采样选择进行深入分析。我们展示模型如何在未被显式指示的情况下,自发地选择复杂度递增、任务相关性递增的样本,并结合执行去噪课程。我们观察到两种系统内部表示类型的互监督信号动态对抽取与翻译性能至关重要。我们表明,就 Gunning-Fog 可读性指数而言,SSNMT 从适合高中生的维基百科数据开始抽取与学习,并迅速转向适合大学一年级学生的内容。
引用
@article{arxiv.2004.03151,
title = {Self-Induced Curriculum Learning in Self-Supervised Neural Machine Translation},
author = {Dana Ruiter and Josef van Genabith and Cristina España-Bonet},
journal= {arXiv preprint arXiv:2004.03151},
year = {2020}
}
备注
12 pages, 5 images, to be published at EMNLP2020