SingingSDS:面向对话角色扮演应用的具备歌唱能力的语音对话系统
声音
2025-12-25 v2
摘要
随着自动语音识别(ASR)、大语言模型(LLM)和文本到语音(TTS)技术的最新进展,语音对话系统(SDS)已变得广泛可及。然而,大多数现有的 SDS 仅限于传统的语音回复。我们提出了 SingingSDS,这是一个级联式 SDS,它通过歌唱而非说话来回应,从而在基于角色的角色扮演和交互式娱乐场景中促进更具情感、更难忘和更愉悦的互动。SingingSDS 采用模块化的 ASR-LLM-SVS 流水线,并支持跨角色人设、ASR 和 LLM 后端、SVS 模型、旋律源和语音配置文件的广泛配置,以适应延迟、质量和音乐风格方面的不同需求。SingingSDS 可作为一个即插即用的网页演示使用,具有支持定制和扩展的模块化开源代码。演示地址:https://huggingface.co/spaces/espnet/SingingSDS。代码地址:https://github.com/SingingSDS/SingingSDS。
引用
@article{arxiv.2511.20972,
title = {SingingSDS: A Singing-Capable Spoken Dialogue System for Conversational Roleplay Applications},
author = {Jionghao Han and Jiatong Shi and Masao Someki and Yuxun Tang and Lan Liu and Yiwen Zhao and Wenhao Feng and Shinji Watanabe},
journal= {arXiv preprint arXiv:2511.20972},
year = {2025}
}