面向端到端同时语音到语音翻译的非自回归生成框架
计算与语言
2024-10-22 v2 人工智能
声音
音频与语音处理
摘要
同时翻译模型在促进沟通方面发挥着关键作用。然而,现有研究主要聚焦于文本到文本或语音到文本模型,需额外的级联组件才能实现语音到语音翻译。这些管道方法 suffer 于误差传播并在每个级联组件中积累延迟,导致同步性降低。为克服这些挑战,我们提出了一个用于同时语音翻译的非自回归生成框架 (NAST-S2X),将语音到文本和语音到语音任务集成到统一的端到端框架中。我们开发了一种非自回归解码器,能够在接收固定长度语音块时同时生成多个文本或声学单元标记。解码器可以生成空白或重复标记并采用 CTC 解码以动态调整其延迟。实验结果表明,NAST-S2X 在语音到文本和语音到语音任务中均优于最先进的模型。它在延迟小于 3 秒的情况下实现了高质量的同步解释,并在离线生成中提供了 28 倍的解码加速。
引用
@article{arxiv.2406.06937,
title = {A Non-autoregressive Generation Framework for End-to-End Simultaneous Speech-to-Speech Translation},
author = {Zhengrui Ma and Qingkai Fang and Shaolei Zhang and Shoutao Guo and Yang Feng and Min Zhang},
journal= {arXiv preprint arXiv:2406.06937},
year = {2024}
}
备注
ACL 2024; Codes and demos are at https://github.com/ictnlp/NAST-S2x