通过生成式 Episodic 指导的双粒度对比奖励:高效具身 RL
机器学习
2026-02-16 v1 机器人学
摘要
在强化学习(RL)中,设计合适的奖励函数是一个重大挑战,尤其是针对具身操作。轨迹成功奖励适合人类评判或模型拟合,但稀疏性严重限制了 RL 的样本效率。虽然最近的方法通过密集奖励显著改进了 RL,但它们依赖大量的人类标注数据或丰富的专家监督。为此,本文提出一种 Dual-granularity contrastive reward via generated Episodic Guidance (DEG),一种新型框架以无需人类标注或广泛监督的方式寻求高效密集奖励。利用大型视频生成模型的先验知识,DEG 只需少量专家视频即可针对每个 RL 剧集生成专用指导。随后,提出的双粒度奖励在粗粒度探索与细粒度匹配之间进行权衡,将引导代理在对比自监督潜在空间中高效逼近生成的指导视频,最终完成目标任务。广泛在仿真和真实环境中的实验表明,DEG 不仅能作为高效探索刺激帮助代理快速发现稀疏成功奖励,还能独立指导有效的 RL 和稳定的策略收敛。
引用
@article{arxiv.2602.12636,
title = {Dual-Granularity Contrastive Reward via Generated Episodic Guidance for Efficient Embodied RL},
author = {Xin Liu and Yixuan Li and Yuhui Chen and Yuxing Qin and Haoran Li and Dongbin Zhao},
journal= {arXiv preprint arXiv:2602.12636},
year = {2026}
}