中文

VoxRole:面向语音角色扮演智能体的综合基准

计算与语言 2025-09-05 v1 人工智能 声音

摘要

近期大型语言模型(LLM)的显著进展极大推动了角色扮演对话智能体(RPCA)的发展。这些系统旨在通过持续的角色采用创造出沉浸式用户体验。然而,当前的 RPCA 研究存在两个局限性:首先,现有工作主要关注文本模态,完全忽略了包括语调、韵律和节奏在内的关键语音副语言特征,这些特征对于传递角色情感和塑造鲜明身份至关重要;其次,语音-based 角色扮演领域长期缺乏标准化的评估基准。大多数当前的口语对话数据集仅针对基础能力评估,具有浅薄或定义不清的角色轮廓,无法有效量化模型在维持角色一致性等核心能力方面的表现。为解决这一关键性空白,我们引入了 VoxRole,第一个专为评估语音-based RPCA 设计的全面基准。该基准包含 13335 轮多轮对话,总计 65.6 小时语音,来自 1228 个独特角色,涵盖 261 部电影。为构建这一资源,我们提出了一种新颖的两阶段自动化管道,首先将电影音频与剧本对齐,然后利用 LLM 系统构建每个角色的多维度轮廓。利用 VoxRole,我们对当代口语对话模型进行了多维度评估,揭示了它们在维持角色一致性方面的具体优势和局限。

关键词

引用

@article{arxiv.2509.03940,
  title  = {VoxRole: A Comprehensive Benchmark for Evaluating Speech-Based Role-Playing Agents},
  author = {Weihao Wu and Liang Cao and Xinyu Wu and Zhiwei Lin and Rui Niu and Jingbei Li and Zhiyong Wu},
  journal= {arXiv preprint arXiv:2509.03940},
  year   = {2025}
}