中文

UniSS:基于您的语音进行统一表达语音到语音翻译

声音 2025-09-26 v1 人工智能

摘要

表达语音到语音翻译(S2ST)的最终目标是准确翻译口语内容,同时保留说话者身份和情感风格。然而,该领域的进展主要受到三个关键挑战的制约:保持表达风格的配对语音数据的稀缺性、复杂的多阶段处理管道以及大型语言模型(LLMs)翻译能力的有限迁移。在本工作中,我们通过引入 UniSS,一个新型单阶段框架来解决这些挑战。我们的方法具备精心设计的语音语义和风格建模,使其能够无缝集成到现有基于文本的 LLM 框架中,以开发统一的文本-语音语言模型。为了将文本到语音的翻译能力从文本迁移到语音,我们提出了一种跨模态链式思维提示过程,逐步对齐音频语义并确保解码结果中的风格保留。在此基础上,我们构建并发布了一个大规模、高质量的表达 S2ST 数据集,称为 UniST,包含 44.8k 小时的数据。实验结果表明,UniSS 在翻译忠实度和语音质量方面显著优于先前方法,同时保持语音、情感和持续时间的一致性。我们的工作建立了构建下一代表达 S2ST 系统的更简单且更有效的范式。音频样本可在 https://cmots.github.io/uniss-demo 访问。

关键词

引用

@article{arxiv.2509.21144,
  title  = {UniSS: Unified Expressive Speech-to-Speech Translation with Your Voice},
  author = {Sitong Cheng and Weizhen Bian and Xinsheng Wang and Ruibin Yuan and Jianyi Chen and Shunshun Yin and Yike Guo and Wei Xue},
  journal= {arXiv preprint arXiv:2509.21144},
  year   = {2025}
}