SDiaReward:基于语义与口语化的多轮 spoken dialogue reward 模型
音频与语音处理
2026-05-12 v2 计算与语言
机器学习
摘要
端到端口语对话系统的快速演进要求超越纯文本语义,融合副语言细微差别和人类自然交谈的自发性。然而,当前方法面临两个关键缺口:语义模式差距,涉及韵律和情感;口语化差距,区分书面脚本与自然语音。为解决这些挑战,我们引入 SDiaReward——一个基于 SDiaReward-Dataset 训练的端到端多轮奖励模型,该数据集是首个针对上述差距构建的剧集级别偏好对集合。其直接作用于完整的多轮语音剧集,并采用成对偏好监督进行优化,实现对语义与口语化的联合评估。我们进一步建立 ESDR-Bench——一个分层的剧集级别评估基准。实验表明,SDiaReward 在成对偏好准确率方面实现了最先进水平,显著优于通用音频大语言模型。进一步分析表明,SDiaReward 捕捉了对话表达性的相对差异,超越表层合成线索,从而提升了跨域和录音条件下的泛化能力。代码、数据和演示已公开于 https://github.com/MM-Speech/SDiaReward/。
引用
@article{arxiv.2603.14889,
title = {SDiaReward: Modeling and Benchmarking Spoken Dialogue Rewards with Modality and Colloquialness},
author = {Jingyu Lu and Yuhan Wang and Fan Zhuo and Xize Cheng and Changhao Pan and Xueyi Pu and Yifu Chen and Chenyuhao Wen and Tianle Liang and Zhou Zhao},
journal= {arXiv preprint arXiv:2603.14889},
year = {2026}
}
备注
Accepted to ACL 2026 Main Conference