用于直接语音翻译的基于 CTC 的压缩方法
计算与语言
2021-10-15 v1
摘要
先前的研究表明,基于音素的动态输入音频压缩有益于语音翻译(ST)。然而,它们需要一个专用的音素识别模型,且未在直接 ST 上测试该方案,在直接 ST 中单一模型将输入音频翻译为目标语言而无需中间表示。在这项工作中,我们提出首个能够对输入进行动态压缩的方法,面向直接 ST 模型。具体而言,我们利用连接时序分类(Connectionist Temporal Classification, CTC)根据其音素特征压缩输入序列。我们的实验表明,相较于强基线,我们的方案在两组语言对(英意和英德)上带来了 1.3-1.5 BLEU 的提升,同时将内存占用减少超过 10%。
引用
@article{arxiv.2102.01578,
title = {CTC-based Compression for Direct Speech Translation},
author = {Marco Gaido and Mauro Cettolo and Matteo Negri and Marco Turchi},
journal= {arXiv preprint arXiv:2102.01578},
year = {2021}
}
备注
Accepted at EACL2021