面向端到端语音翻译的自适应特征选择
计算与语言
2020-10-21 v2 机器学习
声音
音频与语音处理
摘要
语音信号中的信息分布并不均匀,这使得端到端(E2E)语音翻译(ST)在学习聚焦于含信息量的特征时面临额外挑战。本文针对基于编码器-解码器的 E2E ST 提出自适应特征选择(AFS)。我们首先预训练一个 ASR 编码器,并应用 AFS 动态估计每个编码语音特征对语音识别(SR)的重要性。堆叠在 ASR 编码器之上的 ST 编码器随后接收来自(冻结的)ASR 编码器的过滤后特征。我们以 L0DROP(Zhang et al., 2020)作为 AFS 的主干,并将其改造为在时间和特征两个维度上稀疏化语音特征。在 LibriSpeech En-Fr 和 MuST-C 基准上的结果表明,AFS 通过剪除约 84% 的时间特征来促进 ST 的学习,带来约 1.3-1.6 BLEU 的平均翻译提升以及约 1.4 倍的解码加速。特别地,AFS 缩小了与级联基线的性能差距,并在 LibriSpeech En-Fr 上以 18.56 的 BLEU 分数(无数据增强)优于该基线。
引用
@article{arxiv.2010.08518,
title = {Adaptive Feature Selection for End-to-End Speech Translation},
author = {Biao Zhang and Ivan Titov and Barry Haddow and Rico Sennrich},
journal= {arXiv preprint arXiv:2010.08518},
year = {2020}
}
备注
EMNLP2020 Findings; source code is at https://github.com/bzhangGo/zero