聆听回声:基于标量-语言混合强化学习的用户反应感知政策优化
人工智能
2026-03-20 v2
摘要
当前情感支持对话系统通常依赖专家定义的标量奖励进行对齐,但这些信号面临严重的信息稀疏问题。它们无法解释响应为何失败或如何适应动态用户状态,常常偏离促进积极情感转变的实际目标。在实践中,来自用户在持续互动中持续反应的最直接可靠的学习信号。因此,我们提出 Reaction Aware Policy Optimization (RAPO),一个基于 interaction consequences 优化的框架,而非 rubric scores。RAPO 将对话视为反应驱动过程,利用模拟用户响应生成稠密的自然语言反馈,包括三个核心组件:Hindsight Dialogue Selection 识别显著影响用户情感轨迹的关键轮次;Generative Hindsight Feedback 将用户反应转化为对比排序信号和自然语言批评;以及 Scalar-Verbal Hybrid Policy Optimization 将标量奖励优化与语言反馈蒸馏耦合,实现全局对齐与细粒度语义细化。针对 ESC 和 Sotopia 上的大量实验表明,RAPO 在推动积极互动结果方面显著优于强化学习基线方法。
引用
@article{arxiv.2603.15434,
title = {Listening to the Echo: User-Reaction Aware Policy Optimization via Scalar-Verbal Hybrid Reinforcement Learning},
author = {Jing Ye and Xinpei Zhao and Lu Xiang and Yaping Zhang and Chengqing Zong},
journal= {arXiv preprint arXiv:2603.15434},
year = {2026}
}
备注
Updated case study figures for clarity