中文

聆听回声:基于标量-语言混合强化学习的用户反应感知政策优化

人工智能 2026-03-20 v2

摘要

当前情感支持对话系统通常依赖专家定义的标量奖励进行对齐,但这些信号面临严重的信息稀疏问题。它们无法解释响应为何失败或如何适应动态用户状态,常常偏离促进积极情感转变的实际目标。在实践中,来自用户在持续互动中持续反应的最直接可靠的学习信号。因此,我们提出 Reaction Aware Policy Optimization (RAPO),一个基于 interaction consequences 优化的框架,而非 rubric scores。RAPO 将对话视为反应驱动过程,利用模拟用户响应生成稠密的自然语言反馈,包括三个核心组件:Hindsight Dialogue Selection 识别显著影响用户情感轨迹的关键轮次;Generative Hindsight Feedback 将用户反应转化为对比排序信号和自然语言批评;以及 Scalar-Verbal Hybrid Policy Optimization 将标量奖励优化与语言反馈蒸馏耦合,实现全局对齐与细粒度语义细化。针对 ESC 和 Sotopia 上的大量实验表明,RAPO 在推动积极互动结果方面显著优于强化学习基线方法。

关键词

引用

@article{arxiv.2603.15434,
  title  = {Listening to the Echo: User-Reaction Aware Policy Optimization via Scalar-Verbal Hybrid Reinforcement Learning},
  author = {Jing Ye and Xinpei Zhao and Lu Xiang and Yaping Zhang and Chengqing Zong},
  journal= {arXiv preprint arXiv:2603.15434},
  year   = {2026}
}

备注

Updated case study figures for clarity