中文

SpeechRole: A Large-Scale Dataset and Benchmark for Evaluating Speech Role-Playing Agents

计算与语言 2026-03-27 v7

摘要

语音是实现真实角色扮演的关键,但现有工作在角色扮演代理方面主要关注文本,导致 Speech Role-Playing Agents(SRPAs)亟待系统评估。我们引入 SpeechRole,一个用于开发和评估 SRPAs 的统一框架。SpeechRole-Data 包含 98 个角色和 111k 条 speech-to-speech 对话,包含丰富的音色和抑扬顿音变化,为训练 SRPAs 提供了大规模资源。SpeechRole-Eval 提供了一个多维基准,直接评估生成的语音,保留 paralinguistic cues 并衡量交互能力、语音表达性和角色扮演忠实度。实验表明,像 GPT-4o Audio 这样的端到端 SRPAs 在流畅性和自然度方面表现强劲,但在抑扬顿音一致性和情感适当性方面仍有局限。相比之下,当前开源端到端模型在多个评估维度上表现显著不足。级联系统和端到端系统在交互能力和角色扮演忠实度方面取得了相当的结果,这表明这些方面仍然主要受底层基于文本的语言模型的影响。我们在 https://github.com/yuhui1038/SpeechRole 上发布了所有数据、代码和评估工具。

关键词

引用

@article{arxiv.2508.02013,
  title  = {SpeechRole: A Large-Scale Dataset and Benchmark for Evaluating Speech Role-Playing Agents},
  author = {Changhao Jiang and Jiajun Sun and Yifei Cao and Jiabao Zhuang and Xinmeng Che and Hui Li and Xiaoran Fan and Ming Zhang and Junjie Ye and Shihan Dou and Zhiheng Xi and Jingqi Tong and Yilong Wu and Baoyu Fan and Tao Ji and Tao Gui and Qi Zhang and Xuanjing Huang},
  journal= {arXiv preprint arXiv:2508.02013},
  year   = {2026}
}