用于语音翻译的格点 Transformer
计算与语言
2019-06-14 v1
摘要
序列建模的最新进展凸显了 transformer 架构的优势,尤其在实现最先进的机器翻译结果方面。然而,取决于上游系统(例如语音识别或分词),翻译系统的输入可能有很大差异。本工作的目标是扩展 transformer 的注意力机制,使其除了传统的序列输入外还能自然地消费格点(lattice)。我们首先提出一种用于语音翻译的通用格点 transformer,其输入为自动语音识别(ASR)的输出,包含多条路径与后验分数。为利用格点结构带来的额外信息,我们开发了一种新颖的可控格点注意力机制以获取潜在表示。在 LDC 西班牙-英语语音翻译语料库上,我们的实验表明格点 transformer 泛化能力显著更好,且优于 transformer 基线和格点 LSTM。此外,我们在 WMT 2017 中-英翻译任务上用来自不同 BPE 分词的格点输入验证了我们的方法。在该任务中,我们也观察到相对于强基线的提升。
引用
@article{arxiv.1906.05551,
title = {Lattice Transformer for Speech Translation},
author = {Pei Zhang and Boxing Chen and Niyu Ge and Kai Fan},
journal= {arXiv preprint arXiv:1906.05551},
year = {2019}
}
备注
accepted to ACL 2019