中文

流式语音翻译中何时进行翻译的学习

计算与语言 2022-03-23 v4 音频与语音处理

摘要

在给定流式语音输入时,如何找到生成部分句子翻译的合适时刻?现有方法以固定时长等待并翻译,常会打断语音中的声学单元,因为语音中声学单元之间的边界并不均匀。本文中,我们提出 MoSST,一种用于翻译流式语音内容的简单而有效的方法。针对通常较长的语音序列,我们在编码器-解码器模型内开发了高效的单调分割模块,以增量方式累积声学信息并检测语音翻译任务中输入的正确语音单元边界。在 MuST-C 数据集多个翻译方向上的实验表明,MoSST 优于现有方法,并在翻译质量(BLEU)与延迟之间实现了最佳权衡。我们的代码可在 https://github.com/dqqcasia/mosst 获取。

关键词

引用

@article{arxiv.2109.07368,
  title  = {Learning When to Translate for Streaming Speech},
  author = {Qianqian Dong and Yaoming Zhu and Mingxuan Wang and Lei Li},
  journal= {arXiv preprint arXiv:2109.07368},
  year   = {2022}
}

备注

Accept to ACL 2022 main conference. 15 pages, 6 figures