基于视觉提示的可获取导向强化学习
机器人学
2025-07-29 v6 人工智能
机器学习
摘要
配备强化学习 (RL) 的机器人有望仅凭奖励信号就能学习各种技能。然而,为一般操作任务获得稳健且稠密的奖励信号仍然是一个挑战。现有的基于学习的方法需要大量数据,例如人类对成功与失败的演示,以学习任务特定的奖励函数。最近,越来越多地采用大型多模态基础模型用于机器人,能够在物理情境中进行视觉推理并为操作任务生成粗糙的机器人动作。有动机的是这种能力范围,在本工作中,我们提出了一种称为 Keypoint-based Affordance Guidance for Improvements (KAGI) 的方法,利用由视觉语言模型 (VLM) 构成的奖励来实现自主 RL。最先进的 VLM 已在keypoints 上演示了出色的零样本关于可获取性的推理,我们利用这些来定义稠密奖励,以指导自主机器人学习。在由自然语言描述指定的多样化真实操作任务上,KAGI 改进了自主 RL 的样本效率,并在 30K 在线微调步骤内实现了任务完成。此外,我们演示了 KAGI 对减少用于预训练的领域内演示数量的鲁棒性,在 45K 在线微调步骤内接近类似的性能。项目网址:https://sites.google.com/view/affordance-guided-rl
引用
@article{arxiv.2407.10341,
title = {Affordance-Guided Reinforcement Learning via Visual Prompting},
author = {Olivia Y. Lee and Annie Xie and Kuan Fang and Karl Pertsch and Chelsea Finn},
journal= {arXiv preprint arXiv:2407.10341},
year = {2025}
}
备注
8 pages, 6 figures. IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS) 2025