中文

OpenS2S:推进完全开源端到端共情大型语音语言模型

计算与语言 2025-10-28 v3 人工智能 声音 音频与语音处理

摘要

共情交互是人机通信的基石,因为需要理解富含副语言线索的语音并生成情感化和富有表现力的回应。然而,最强大的共情 LSLM 正变得越来越封闭,使得关于架构、数据和开发的关键细节对研究人员不透明。鉴于对 LSLM 和共情行为进行透明研究的迫切需求,我们提出了 OpenS2S,一个完全开源、透明且端到端的 LSLM,旨在实现共情语音交互。基于我们的共情语音到文本模型 BLSP-Emo,OpenS2S 进一步采用流式交错解码架构以实现低延迟语音生成。为促进端到端训练,OpenS2S 集成了一个自动化数据构建流水线,能够以低成本合成多样化、高质量的共情语音对话。通过利用大型语言模型生成共情内容,以及可控文本到语音系统引入说话人和情感变化,我们构建了一个具有丰富副语言多样性和最少人工监督的可扩展训练语料库。我们发布了完全开源的 OpenS2S 模型,包括数据集、模型权重、预训练和微调代码,以赋能更广泛的研究社区并加速共情语音系统的创新。项目网页可访问 https://casia-lm.github.io/OpenS2S。

关键词

引用

@article{arxiv.2507.05177,
  title  = {OpenS2S: Advancing Fully Open-Source End-to-End Empathetic Large Speech Language Model},
  author = {Chen Wang and Tianyu Peng and Wen Yang and Yinan Bai and Guangfu Wang and Jun Lin and Lanpeng Jia and Lingxiang Wu and Jinqiao Wang and Chengqing Zong and Jiajun Zhang},
  journal= {arXiv preprint arXiv:2507.05177},
  year   = {2025}
}

备注

Technical Report, Update on OpenS2S_v1.5