中文

基于音色感知 LLM 的可扩展至多语言对的直接语音到语音翻译

音频与语音处理 2026-01-23 v1 人机交互

摘要

直接语音到语音翻译因其能够将语音从一种语言翻译成另一种语言,同时减少传统级联流程中固有的错误传播和延迟而受到越来越多的关注。然而,现有的直接 S2ST 系统仍然面临显著挑战,包括在平行语音数据稀缺时语义-声学对齐的不稳定性、难以保留说话人身份以及有限的多语言可扩展性。在这项工作中,我们引入了 DS2ST-LM,这是一个可扩展的单阶段直接 S2ST 框架,利用了多语言大语言模型。该架构集成了一个 Whisper 语音编码器、一个可学习的投影模块、一个 Qwen2-0.5B LLM 和一个音色控制的声码器。我们通过使用高保真合成目标语音扩展 GigaST 数据集,构建了 GigaS2S-1000,一个 1000 小时的双语语料库,并表明这种合成数据在一定程度上缓解了数据稀缺问题。我们研究了两种语义令牌生成策略:语音衍生的 S3 令牌和由预训练 LLM 生成的文本衍生令牌,并分析了它们对训练稳定性和语义一致性的影响。我们进一步评估了三种投影架构(Linear、Conv1D-Linear 和 Q-Former),并观察到虽然更高容量的投影器收敛更快,但简单的 Linear 投影器取得了更高的性能。大量实验表明,DS2ST-LM 在词汇(BLEU、METEOR)和语义(BLEURT、COMET)指标上均优于传统的级联和 ST (Qwen-Audio) + TTS 基线,同时扩展到多个语言对,包括法语、西班牙语、德语、印地语、孟加拉语和乌尔都语。此外,我们结合了音色感知的语音合成以保留说话人信息,使 DS2ST-LM 在说话人相似度和感知自然度方面超越了先前的直接 S2ST 系统。

关键词

引用

@article{arxiv.2601.16023,
  title  = {Timbre-Aware LLM-based Direct Speech-to-Speech Translation Extendable to Multiple Language Pairs},
  author = {Lalaram Arya and Mrinmoy Bhattacharjee and Adarsh C. R. and S. R. Mahadeva Prasanna},
  journal= {arXiv preprint arXiv:2601.16023},
  year   = {2026}
}

备注

13 pages