面向LLM/VLM强化学习的新鲜感感知优先经验回放
计算与语言
2026-04-21 v1 机器学习
摘要
强化学习(RL)在后训练大语言模型(LLM)和视觉语言模型(VLM)方面取得了显著成功,以单次梯度更新为主的单向算法(如PPO、GRPO和REINFORCE++)占主导地位。然而,这些方法在完成单次梯度更新后会丢弃所有收集的轨迹,导致样本效率差,尤其在需要多轮环境交互的智能体任务中尤为浪费。虽然经验回放通过允许代理人重用过去的轨迹并优先选择有信息量的轨迹来提高样本效率,但直接将优先经验回放(PER)应用于LLM失败。由于十亿参数模型的快速策略演化,存储的优先级会变得陈旧,导致过时的高优先级轨迹在长期主导采样。我们提出新鲜感感知PER,通过在任何PER基础优先级上引入乘法性指数衰减来解决优先级陈旧问题。到我们知识,这是首个成功将PER应用于LLM/VLM强化学习的工作。我们在八个多步骤智能体、推理和数学竞赛任务上进行评估,分别使用0.5B、3B和7B模型。实验表明,新鲜感感知PER相对于单向基线显著优于标准PER,在NQ Search上提升46%,Sokoban上提升367%,VLM FrozenLake上提升133%。而标准PER在不考虑年龄衰减的情况下持续损害性能。我们的代码已公开:https://github.com/Vision-CAIR/Freshness-Aware-PER。
引用
@article{arxiv.2604.16918,
title = {Freshness-Aware Prioritized Experience Replay for LLM/VLM Reinforcement Learning},
author = {Weiyu Ma and Yongcheng Zeng and Yan Song and Xinyu Cui and Jian Zhao and Xuhui Liu and Mohamed Elhoseiny},
journal= {arXiv preprint arXiv:2604.16918},
year = {2026}
}