RLVER:基于可验证情感奖励的强化学习情感代理
计算与语言
2026-03-05 v1 人工智能
计算机与社会
摘要
大型语言模型 (LLMs) 在逻辑和算法推理方面表现出色,但其情感智能 (EQ) 仍远远落后于其认知能力。虽然从可验证奖励 (RLVR) 的强化学习在其他领域取得了进展,但其应用于对话-尤其是情感智能-仍未得到充分探索。在本工作中,我们引入 RLVER,这是第一个端到端的强化学习框架,用于利用来自模拟用户的可验证情感奖励来培育更高阶的同理心能力。该框架内的 self-consistent 情感模拟用户在对话 rollout 中进行交互,并在对话期间产生确定性情感分数,作为奖励信号来指导 LLM 的学习。使用 PPO 对公开可用的 Qwen2.5-7B-Instruct 模型进行微调后,其 Sentient-Benchmark 分数从 13.3 提升到 79.2,同时基本保持了数学和编程能力。广泛的实验结果表明:(i) RLVER 在多个对话能力上一致性地提高;(ii) 思考模型和非思考模型显示出不同的趋势--思考模型在同理心和洞察方面表现出色,而非思考模型更侧重于行动;(iii) GRPO 通常会产生稳定的收益,而 PPO 可以将某些能力推向更高的天花板;(iv) 更具挑战性的环境并不总是更好的--中等难度环境可能产生更强的效果。我们的结果表明,RLVER 是通往情感智能和广泛能力语言代理的实用道路。
引用
@article{arxiv.2507.03112,
title = {RLVER: Reinforcement Learning with Verifiable Emotion Rewards for Empathetic Agents},
author = {Peisong Wang and Ruotian Ma and Bang Zhang and Xingyu Chen and Zhiwei He and Kang Luo and Qingsong Lv and Qingxuan Jiang and Zheng Xie and Shanyi Wang and Yuan Li and Fanghua Ye and Jian Li and Yifan Yang and Zhaopeng Tu and Xiaolong Li},
journal= {arXiv preprint arXiv:2507.03112},
year = {2026}
}
备注
Code: https://github.com/Tencent/DigitalHuman/tree/main/RLVER