中文

面向端到端同时语音到语音翻译的非自回归生成框架

计算与语言 2024-10-22 v2 人工智能 声音 音频与语音处理

摘要

同时翻译模型在促进沟通方面发挥着关键作用。然而,现有研究主要聚焦于文本到文本或语音到文本模型,需额外的级联组件才能实现语音到语音翻译。这些管道方法 suffer 于误差传播并在每个级联组件中积累延迟,导致同步性降低。为克服这些挑战,我们提出了一个用于同时语音翻译的非自回归生成框架 (NAST-S2X),将语音到文本和语音到语音任务集成到统一的端到端框架中。我们开发了一种非自回归解码器,能够在接收固定长度语音块时同时生成多个文本或声学单元标记。解码器可以生成空白或重复标记并采用 CTC 解码以动态调整其延迟。实验结果表明,NAST-S2X 在语音到文本和语音到语音任务中均优于最先进的模型。它在延迟小于 3 秒的情况下实现了高质量的同步解释,并在离线生成中提供了 28 倍的解码加速。

关键词

引用

@article{arxiv.2406.06937,
  title  = {A Non-autoregressive Generation Framework for End-to-End Simultaneous Speech-to-Speech Translation},
  author = {Zhengrui Ma and Qingkai Fang and Shaolei Zhang and Shoutao Guo and Yang Feng and Min Zhang},
  journal= {arXiv preprint arXiv:2406.06937},
  year   = {2024}
}

备注

ACL 2024; Codes and demos are at https://github.com/ictnlp/NAST-S2x