中文

用于直接语音翻译的基于 CTC 的压缩方法

计算与语言 2021-10-15 v1

摘要

先前的研究表明,基于音素的动态输入音频压缩有益于语音翻译(ST)。然而,它们需要一个专用的音素识别模型,且未在直接 ST 上测试该方案,在直接 ST 中单一模型将输入音频翻译为目标语言而无需中间表示。在这项工作中,我们提出首个能够对输入进行动态压缩的方法,面向直接 ST 模型。具体而言,我们利用连接时序分类(Connectionist Temporal Classification, CTC)根据其音素特征压缩输入序列。我们的实验表明,相较于强基线,我们的方案在两组语言对(英意和英德)上带来了 1.3-1.5 BLEU 的提升,同时将内存占用减少超过 10%。

关键词

引用

@article{arxiv.2102.01578,
  title  = {CTC-based Compression for Direct Speech Translation},
  author = {Marco Gaido and Mauro Cettolo and Matteo Negri and Marco Turchi},
  journal= {arXiv preprint arXiv:2102.01578},
  year   = {2021}
}

备注

Accepted at EACL2021