中文

Speech-DRAME:面向语音角色扮演的人类对齐基准框架

声音 2025-11-04 v1 人工智能 音频与语音处理

摘要

角色扮演已成为生成模型的关键测试基准,扩展范围从文本对话到多模态交互。将角色扮演扩展到语音捕获语调、情感和递交,但也带来了新的评估挑战。当前管道常使用音频大语言模型(ALLMs)作为零-shot 评判器,忽略语音的非语言线索, 将多个方面合并为粗糙评分,并依赖反映真实世界角色的合成语音参考。我们提出 Speech-DRAME,一个统一框架在三个层面做出贡献:(i)Speech-DRAME-EvalBench,一个包含双语人工标注数据和协议的评估基准,用于训练和测试语音评估模型(SEMs),(ii)DRAME-Eval,一个精调后的评估模型,显著优于零-shot 和 few-shot ALLMs,(iii)Speech-DRAME-RoleBench,一个语音角色扮演基准,利用 DRAME-Eval 作为自动评判器来比较语音基础模型(SFMs)。Speech-DRAME distinguish between two complementary evaluation strategies: Archetype Evaluation,一种自上而下的方法,衡量对广泛角色原型的一致性,和 Realism Evaluation,一种基于真实人类语音的自下而上方法,强调细致的角色质量。与零-shot ALLM 评判器相比,DRAME-Eval 在原型和现实主义评估中的人类评分一致性分别从 0.480 提升到 0.629 和 0.390 提升到 0.625。通过集成透明的基准资源、建模方法和 system-level 评估,Speech-DRAME 提供了 assessing spoken role-play 的第一个全面、可重复的 foundation。

关键词

引用

@article{arxiv.2511.01261,
  title  = {Speech-DRAME: A Framework for Human-Aligned Benchmarks in Speech Role-Play},
  author = {Jiatong Shi and Jionghao Han and Yichen Lu and Santiago Pascual and Pengfei Wu and Chenye Cui and Shinji Watanabe and Chao Weng and Cong Zhou},
  journal= {arXiv preprint arXiv:2511.01261},
  year   = {2025}
}

备注

67 pages