Dub-S2ST:面向无缝配音的无文本语音到语音翻译
计算与语言
2025-12-30 v2 声音
音频与语音处理
摘要
本文介绍了一个跨语言配音系统,该系统将语音从一种语言翻译为另一种语言,同时保留时长、说话人身份和语速等关键特征。尽管现有的语音翻译方法具有很强的翻译质量,但它们往往忽略了语音模式的迁移,导致与源语音不匹配,从而限制了其在配音应用中的适用性。为了解决这一问题,我们提出了一种具有显式时长控制的基于离散扩散的语音到单元翻译模型,以实现时间对齐的翻译。随后,我们使用条件流匹配模型,基于翻译后的单元和源说话人身份合成语音。此外,我们引入了一种基于单元的语速自适应机制,该机制引导翻译模型产生与源语速一致的语音,且不依赖任何文本。大量实验表明,我们的框架生成了自然流畅的翻译,与原始语音的时长和语速相匹配,同时实现了具有竞争力的翻译性能。代码可在 https://github.com/kaistmm/Dub-S2ST 获取。
引用
@article{arxiv.2505.20899,
title = {Dub-S2ST: Textless Speech-to-Speech Translation for Seamless Dubbing},
author = {Jeongsoo Choi and Jaehun Kim and Joon Son Chung},
journal= {arXiv preprint arXiv:2505.20899},
year = {2025}
}
备注
EMNLP 2025 Findings