中文

基于 AI 反馈强化学习优化语音对话系统的对话质量

计算与语言 2026-01-28 v1 声音

摘要

语音进/语音出对话系统的强化学习人类或 AI 反馈(RLHF/RLAIF)仍属探索阶段,已有工作主要局限于在言语层面上施加单一语义奖励。此类设置忽略了对话质量的多维度和多模态特性,其涵盖语义连贯性、音频自然性、说话人一致性、情感匹配以及轮次衔接行为。此外,这些方法本质上与增量式、双工语音对话系统不匹配——后者必须基于部分言语做出决策。我们提出首个针对语音对话系统的多奖励 RLAIF 框架,融合语义奖励、音频质量奖励和情感一致性奖励。为将言语层面的偏好与增量式、块状解码在双工模型中对齐,我们应用轮次级偏好抽样,并在单一 DPO 目标内聚合每个块的对数概率。我们首次系统性研究了在多轮链路思考和块状双工模型中提升对话系统质量的偏好学习,并发布了多奖励 DPO 数据集以支持可复现的研究。实验表明,单奖励 RLAIF仅能有选择性地提升其目标指标,而联合多奖励训练则在语义质量和音频自然性方面实现持续性提升。这些结果凸显了面向实际对话语音对话系统的整体性、多奖励对齐的重要性。

关键词

引用

@article{arxiv.2601.19063,
  title  = {Optimizing Conversational Quality in Spoken Dialogue Systems with Reinforcement Learning from AI Feedback},
  author = {Siddhant Arora and Jinchuan Tian and Jiatong Shi and Hayato Futami and Yosuke Kashiwagi and Emiru Tsunoo and Shinji Watanabe},
  journal= {arXiv preprint arXiv:2601.19063},
  year   = {2026}
}