基于结构的课程学习用于端到端英日语音翻译
计算与语言
2018-02-19 v1 声音
音频与语音处理
摘要
基于序列到序列注意力机制的神经网络架构已被证明为机器翻译和语音识别提供了强大的模型。最近,若干工作尝试将这些模型扩展至端到端语音翻译任务。然而,这些模型的有效性仅在句法与词序相似的语言对(如英语-法语或英语-西班牙语)上进行了研究。本文关注句法距离较远的语言对(如英语-日语)上的端到端语音翻译任务,其需要远距离的词重排。为引导编码器-解码器注意力模型学习这一困难问题,我们提出了一种基于结构的课程学习策略。与传统的逐渐强调困难数据样本的课程序学习不同,我们将学习策略形式化为从较简单的网络结构到较困难的网络结构。在此,我们以用于语音识别或基于文本的机器翻译任务的端到端编码器-解码器训练为起点,再逐步过渡到端到端语音翻译任务。实验结果表明,与无课程学习的方法相比,所提方法能带来显著改进。
引用
@article{arxiv.1802.06003,
title = {Structured-based Curriculum Learning for End-to-end English-Japanese Speech Translation},
author = {Takatomo Kano and Sakriani Sakti and Satoshi Nakamura},
journal= {arXiv preprint arXiv:1802.06003},
year = {2018}
}