稳定对比强化学习:从离线数据实现机器人目标到达的技术
机器学习
2025-06-11 v3 人工智能
摘要
主要依赖自监督学习的机器人系统,有潜力降低学习控制策略所需的人工标注与工程投入。正如先前的机器人系统利用了来自计算机视觉(CV)和自然语言处理(NLP)的自监督技术,我们的工作建立在先前研究之上,这些研究表明强化学习(RL)本身可被视为一个自监督问题:无需人工指定奖励或标签即可学习到达任意目标。尽管看似吸引人,但先前几乎(如果有的话)没有工作展示自监督 RL 方法如何实际部署于机器人系统。通过首先研究该任务的一个具有挑战性的仿真版本,我们发现了关于架构与超参数的设计决策,将成功率提高了 。这些发现为我们主要结果奠定了基础:我们证明了一种基于对比学习的自监督 RL 算法能够解决真实的、基于图像的机器人操控任务,任务由训练后提供的一张目标图像指定。
引用
@article{arxiv.2306.03346,
title = {Stabilizing Contrastive RL: Techniques for Robotic Goal Reaching from Offline Data},
author = {Chongyi Zheng and Benjamin Eysenbach and Homer Walke and Patrick Yin and Kuan Fang and Ruslan Salakhutdinov and Sergey Levine},
journal= {arXiv preprint arXiv:2306.03346},
year = {2025}
}
备注
ICLR 2024 Spotlight (< 5%). Website (https://chongyi-zheng.github.io/stable_contrastive_rl) and code (https://github.com/chongyi-zheng/stable_contrastive_rl)