中文

WavReward:面向 spoken dialogue 模型的通用奖励评估器

音频与语音处理 2025-09-24 v2 人工智能 机器学习 多媒体 声音

摘要

端到端 spoken dialogue 模型如GPT-4o-audio最近在语音领域引起了广泛关注。然而,spoken dialogue 模型的对话性能评估工作基本被忽视。这主要是由于智能聊天机器人传递了大量非文本信息,难以使用类似ChatGPT的文本基语言模型进行衡量。为此,我们提出WavReward,一种基于音频语言模型的奖励反馈模型,可评估以语音输入的 spoken dialogue 系统的智力(IQ)和情感(EQ)。具体地,1)基于音频语言模型,WavReward集成了深度推理过程和非线性奖励机制,用于后训练。通过利用多样化反馈的强化学习算法,我们构建了一个专为spoken dialogue 模型设计的评估器。2)我们引入ChatReward-30K,用于训练WavReward的偏好数据集。ChatReward-30K涵盖了spoken dialogue 模型的理解与生成各方面的场景。这些场景涉及各种任务,如基于文本的聊天、九种语音属性的指令聊天以及隐式聊天。WavReward在多个spoken dialogue 场景中超越了之前的领先评估模型,使Qwen2.5-Omni在客观准确性上从53.4%提升至91.5%。在主观A/B测试中,WavReward也以83%的优势领先。全面的数据消除研究确认了WavReward每个组件的必要性。所有数据和代码将在论文接受后公开于https://github.com/jishengpeng/WavReward。

关键词

引用

@article{arxiv.2505.09558,
  title  = {WavReward: Spoken Dialogue Models With Generalist Reward Evaluators},
  author = {Shengpeng Ji and Tianle Liang and Yangzhuo Li and Jialong Zuo and Minghui Fang and Jinzheng He and Yifu Chen and Zhengqing Liu and Ziyue Jiang and Xize Cheng and Siqi Zheng and Jin Xu and Junyang Lin and Zhou Zhao},
  journal= {arXiv preprint arXiv:2505.09558},
  year   = {2025}
}