中文

StreamSpeech:基于多任务学习的同时语音到语音翻译

计算与语言 2024-06-06 v1 人工智能 声音 音频与语音处理

摘要

Simultaneous speech-to-speech translation (Simul-S2ST, 即流式语音翻译) 在接收流式语音输入时输出目标语音,这对于实现实时沟通至关重要。除了在语音之间完成翻译之外,Simul-S2ST 还需要一种策略来控制模型在语音输入中的适当时机生成对应的目标语音,从而提出翻译和策略的双重挑战。本文提出 StreamSpeech,一个直接的 Simul-S2ST 模型,在多任务学习框架中联合学习翻译和同步策略。遵循多任务学习方法,StreamSpeech 可以通过一个“全能一体”的无缝模型执行离线和同步语音识别、语音翻译和语音合成。在 CVSS benchmark 上的实验表明,StreamSpeech 在离线 S2ST 和 Simul-S2ST 任务上均实现了最新成果 (SOTA)。此外,StreamSpeech 能够在同步翻译过程中呈现高质量的中间结果 (即 ASR 或翻译结果),为提供更全面的实时沟通体验。

关键词

引用

@article{arxiv.2406.03049,
  title  = {StreamSpeech: Simultaneous Speech-to-Speech Translation with Multi-task Learning},
  author = {Shaolei Zhang and Qingkai Fang and Shoutao Guo and Zhengrui Ma and Min Zhang and Yang Feng},
  journal= {arXiv preprint arXiv:2406.03049},
  year   = {2024}
}

备注

Accepted to ACL 2024 main conference, Project Page: https://ictnlp.github.io/StreamSpeech-site/