Speechformer:减少直接语音翻译中的信息损失
计算与语言
2023-10-19 v1
摘要
基于 Transformer 的模型日益流行,在包括语音翻译在内的许多研究领域取得了最先进的性能。然而,Transformer 相对于输入序列长度的二次复杂度阻碍了其直接应用于通常由长序列表示的音频信号。目前的解决方案采用基于原始音频特征固定采样的初始次优压缩。因此,架构中的较高层无法获取潜在有用的语言信息。为解决此问题,我们提出 Speechformer,该架构得益于注意力层中内存使用的减少,避免了初始有损压缩,并根据更具信息量的语言标准仅在较高层聚合信息。在三个语言对(en->de/es/nl)上的实验表明了我们解决方案的有效性,在标准 MuST-C 语料库上获得了高达 0.8 BLEU 的增益,在低资源场景下获得了高达 4.0 BLEU 的增益。
引用
@article{arxiv.2109.04574,
title = {Speechformer: Reducing Information Loss in Direct Speech Translation},
author = {Sara Papi and Marco Gaido and Matteo Negri and Marco Turchi},
journal= {arXiv preprint arXiv:2109.04574},
year = {2023}
}
备注
Accepted to EMNLP 2021 Main Conference