中文

Seed LiveInterpret 2.0: 保留您声音的端到端同声传译

计算与语言 2025-07-29 v3 声音 音频与语音处理

摘要

同声传译(SI)是翻译行业中最具挑战性的前沿领域之一,产品级的自动系统长期以来一直受到棘手问题的困扰:转录和翻译质量欠佳、缺乏实时语音生成、多说话人混淆以及翻译语音膨胀,尤其是在长篇话语中。在本研究中,我们介绍了Seed-LiveInterpret 2.0,一个端到端的SI模型,能够实现高保真、超低延迟的语音到语音生成,并具备声音克隆能力。作为一个完全可运行的产品级解决方案,Seed-LiveInterpret 2.0通过我们新颖的双工语音理解-生成框架直面这些挑战。实验结果表明,通过大规模预训练和强化学习,该模型在翻译准确性和延迟之间实现了显著更好的平衡,经人工译员验证,在复杂场景下正确率超过70%。值得注意的是,Seed-LiveInterpret 2.0在翻译质量上大幅超越商业SI解决方案,同时将克隆语音的平均延迟从近10秒削减至接近实时的3秒,这大约减少了70%,极大地提升了实际可用性。

关键词

引用

@article{arxiv.2507.17527,
  title  = {Seed LiveInterpret 2.0: End-to-end Simultaneous Speech-to-speech Translation with Your Voice},
  author = {Shanbo Cheng and Yu Bao and Zhichao Huang and Yu Lu and Ningxin Peng and Lu Xu and Runsheng Yu and Rong Cao and Yujiao Du and Ting Han and Yuxiang Hu and Zeyang Li and Sitong Liu and Shengtao Ma and Shiguang Pan and Jiongchen Xiao and Nuo Xu and Meng Yang and Rong Ye and Yiming Yu and Jun Zhang and Ruofei Zhang and Wanyi Zhang and Wenhao Zhu and Liehao Zou and Lu Lu and Yuxuan Wang and Yonghui Wu},
  journal= {arXiv preprint arXiv:2507.17527},
  year   = {2025}
}

备注

Seed-LiveInterpret 2.0 Technical Report