用于语音识别与直接翻译的相对位置编码
音频与语音处理
2020-05-21 v1 计算与语言
声音
摘要
Transformer模型是强大的序列到序列架构,能够直接将语音输入映射为转写文本或翻译文本。然而,该模型中建模位置的机制是为文本建模量身定制的,因而对声学输入而言不够理想。本工作中,我们将相对位置编码方案适配于Speech Transformer,其关键新增项为负注意力网络中输入状态间的相对距离。由此,网络能更好地适应语音数据中存在的可变分布。我们的实验表明,所得模型在Switchboard基准的非增强条件下取得最佳识别结果,并在MuST-C语音翻译基准上取得已发表的最佳结果。我们还表明,该模型比Transformer能更好地利用合成数据,且对语音翻译中可变的句子分割质量具有更好的适应性。
引用
@article{arxiv.2005.09940,
title = {Relative Positional Encoding for Speech Recognition and Direct Translation},
author = {Ngoc-Quan Pham and Thanh-Le Ha and Tuan-Nam Nguyen and Thai-Son Nguyen and Elizabeth Salesky and Sebastian Stueker and Jan Niehues and Alexander Waibel},
journal= {arXiv preprint arXiv:2005.09940},
year = {2020}
}
备注
Submitted to Interspeech 2020