中文

编码与分割策略对端到端同步语音翻译的影响

计算与语言 2021-06-15 v2 声音 音频与语音处理

摘要

在IWSLT 2020同步翻译共享任务的推动下,近期提出了有前景的端到端在线语音翻译方法。它们包括增量编码语音输入(源语言)并以延迟与翻译质量间最佳权衡解码相应文本(目标语言)。本文探究端到端同步语音翻译的两个关键方面:(a)如何高效编码连续语音流,以及(b)如何分割语音流以在读取(R:编码输入)与写入(W:解码输出)操作间最优交替。我们扩展了先前提出的端到端在线解码策略,并表明虽然用ULSTM编码替代BLSTM在离线模式下降低性能,但其实际在在线模式下同时提升效率与性能。我们还度量了分割语音信号的不同方法(使用固定间隔边界、预言词边界或随机设定边界)的影响,并表明在我们英德语音翻译设定下,我们最佳的端到端在线解码策略出乎意料地是在固定大小块上交替R/W操作的策略。

关键词

引用

@article{arxiv.2104.14470,
  title  = {Impact of Encoding and Segmentation Strategies on End-to-End Simultaneous Speech Translation},
  author = {Ha Nguyen and Yannick Estève and Laurent Besacier},
  journal= {arXiv preprint arXiv:2104.14470},
  year   = {2021}
}

备注

Accepted for presentation at Interspeech 2021