中文

S2ST-Omni:面向多语言语音到语音翻译的层次化语言感知 SpeechLLM 适配

音频与语音处理 2026-01-07 v6 声音

摘要

尽管近期在语音到语音翻译(speech-to-speech translation, S2ST)方面取得了进展,但仍难以实现高的翻译准确率和实际的灵活性。本文提出S2ST-Omni,一个组合化的S2ST框架,将高精度语音到文本翻译(speech-to-text translation, S2TT)前端与模块化、可插拔的文本到语音(text-to-speech, TTS)后端集成,使翻译与合成能够独立优化。在S2TT侧,我们引入一种混合适配器,遵循“局部后全局”策略,以桥接预训练的Whisper编码器与Qwen3大语言模型,构建层次化的声学到语义抽象。基于该桥接,我们进一步提出层次化语言感知架构,在两个互补的层面注入源语言信息。在声学层面,Language-Aware Dual-CTC作用于中间适配器特征,并采用带可学习门控的FiLM风格特征调制,鼓励模型学习语言特定但内容忠实的声学表征。在语言层面,Language-Aware Prompting动态构建源语言条件化提示,以激活大语言模型中的语言特定翻译知识。为实现高效优化,我们设计了面向特定任务的渐进微调策略,首先稳定语音-文本对齐,然后通过在此收敛基础上叠加LoRA来提升翻译。TTS后端保持完全模块化,可使用任何最新的语音合成器实例化,而无需重新训练S2TT前端。在CVSS-C上的实验表明,S2ST-Omni在法语、德语和西班牙语到英语方向上持续实现最佳BLEU和ASR-BLEU,优于强大的近期S2ST基线。

关键词

引用

@article{arxiv.2506.11160,
  title  = {S2ST-Omni: Hierarchical Language-Aware SpeechLLM Adaptation for Multilingual Speech-to-Speech Translation},
  author = {Yu Pan and Xiongfei Wu and Yuguang Yang and Jixun Yao and Lei Ma and Jianjun Zhao},
  journal= {arXiv preprint arXiv:2506.11160},
  year   = {2026}
}

备注

Working in progress