中文

角色角色评估在音频大语言模型中的作用:通过强化学习

机器学习 2026-04-16 v1

摘要

多模态大模型的快速发展正在革新语音对话系统中多样化角色的模拟能力,开启了一种新的交互范式。角色属性不仅体现在文本响应中,还通过语音特征体现出来,因为语音传递了丰富的语篇信息,这些信息难以量化。这给评估角色对齐的角色扮演智能体的角色属性带来了重大挑战。为此,我们提出了 RoleJudge,这是一个利用音频大语言模型系统性评估语音与角色跨多个模态和维度对齐的评估框架。此外,我们引入了 RoleChat,这是第一个以链式思考推理注释丰富的语音角色扮演评估数据集,包含多样化的真实语音样本和由 LLM 生成的语音样本。利用该数据集,我们实现了多阶段训练范式,并纳入标准对齐以缓解强化学习期间的奖励不对齐。实验结果在准确性和主观评估方面均表明,RoleJudge 在各种基线模型方面表现优异,验证了我们多维度评估框架的有效性。

关键词

引用

@article{arxiv.2604.13804,
  title  = {Character Beyond Speech: Leveraging Role-Playing Evaluation in Audio Large Language Models via Reinforcement Learning},
  author = {Dongjie Fu and Fangming Feng and Xize Cheng and Linjun Li and Zhou Zhao and Tao Jin},
  journal= {arXiv preprint arXiv:2604.13804},
  year   = {2026}
}