RankQ:通过自监督动作排序实现离线到在线强化学习
人工智能
2026-05-21 v2 机器人学
摘要
离线到在线强化学习 (RL) 通过利用在线交互前的预收集数据集来提高样本效率。一个关键挑战是,在大型状态-动作空间中以有限数据集覆盖率学习准确的批评家。为缓解来自价值过度估计的有害更新,先前方法通过对相对数据集动作的动作进行低加权来施加乐观主义。虽然有效,但这本质上是一个行为克隆锚点,可能阻碍数据集动作次优时的数据集在下游在线策略改进中。我们提出了 RankQ,一种通过自监督多项排序损失增强时序差分学习的离线到在线 Q 学习目标,以强结构化动作排序来实现。通过学习相对动作偏好,而不是对未看到的动作进行均匀惩罚,RankQ 塑造了 Q 函数,使得动作梯度指向更高质量的行为。在稀疏奖励 D4RL 基准测试中,RankQ 的性能与七个先前方法相竞争或优于。在基于视觉的机器人学习中,RankQ 使预训练的视觉-语言-动作 (VLA) 模型在低数据 regime 下实现有效的离线到在线微调,平均模拟成功率比最佳方法高出 42.7%。在高数据 regime 下,RankQ 将模拟性能提高 13.7%,并实现强劲的仿真到现实迁移,将真实世界的立方堆叠成功率从 43.1% 提升到 88.9%。
引用
@article{arxiv.2605.11151,
title = {RankQ: Offline-to-Online Reinforcement Learning via Self-Supervised Action Ranking},
author = {Andrew Choi and Wei Xu},
journal= {arXiv preprint arXiv:2605.11151},
year = {2026}
}