中文

基于 CTC 的无自回归无文本语音到语音翻译

计算与语言 2024-06-12 v1 人工智能 声音 音频与语音处理

摘要

直接语音到语音翻译 (S2ST) 已取得令人印象深刻的翻译质量,但往往面临由于 speech 序列长度较大导致的解码速度慢的挑战。最近,一些研究转向使用无自回归 (NAR) 模型以加快解码速度,但翻译质量通常显著落后于自回归 (AR) 模型。在本文中,我们调查了基于 CTC 的 NAR 模型在 S2ST 中的性能,因为这些模型在机器翻译中已显示出惊人的效果。实验结果表明,通过结合 pretraining、知识蒸馏以及先进的 NAR 训练技术(如 glancing training 和 non-monotonic latent alignments),CTC 基于 NAR 的模型在保持最高可达 26.81 倍解码加速的同时,能够实现与 AR 模型相当的翻译质量。

关键词

引用

@article{arxiv.2406.07330,
  title  = {CTC-based Non-autoregressive Textless Speech-to-Speech Translation},
  author = {Qingkai Fang and Zhengrui Ma and Yan Zhou and Min Zhang and Yang Feng},
  journal= {arXiv preprint arXiv:2406.07330},
  year   = {2024}
}

备注

ACL 2024 Findings