利用扩散模型实现语音到语音任务中的语言翻译与口音转换
计算与语言
2025-05-09 v1 人工智能
摘要
语音到语音翻译(S2ST)旨在将一种语言的口语输入转换为另一种语言的口语输出,通常侧重于语言翻译或口音适应。然而,有效的跨文化交流需要同时处理这两个方面——在翻译内容的同时,调整说话者的口音以匹配目标语言语境。在这项工作中,我们提出了一种同时进行语音翻译和口音转换的统一方法,这一任务在当前文献中尚未得到充分探索。我们的方法将该问题重新定义为一个条件生成任务,其中目标语音基于音素生成,并由目标语音特征引导。利用扩散模型高保真生成能力的优势,我们通过以源语音转录为条件,并生成代表具有期望语言和口音属性的目标语音的梅尔频谱图,来适配文本到图像的扩散策略。这种集成框架实现了翻译和口音适应的联合优化,与传统流水线方法相比,提供了一个参数更高效、效果更佳的模型。
引用
@article{arxiv.2505.04639,
title = {Language translation, and change of accent for speech-to-speech task using diffusion model},
author = {Abhishek Mishra and Ritesh Sur Chowdhury and Vartul Bahuguna and Isha Pandey and Ganesh Ramakrishnan},
journal= {arXiv preprint arXiv:2505.04639},
year = {2025}
}