中文

PRISM:基于投影的场景感知实到仿真到实迁移方法,少数演示即可实现

机器人学 2025-04-30 v1 人工智能

摘要

从少数演示中学习策略,以应对机器人初始位置和物体姿态变化,这一问题在机器人领域具有重要实际意义。与仿射学习相比,后者往往难以从有限样本中泛化,而强化学习(RL)可通过自主探索获得鲁棒行为。通过直接与真实世界交互进行 RL 代理的训练往往不切实际且不安全,而构建仿真环境则需要大量手动工作,如设计场景和编写任务特定奖励函数。为此,我们提出了一个集成的实到仿真到实管线,通过从图像中识别场景物体并从现有库中检索其对应的3D模型来构建仿真环境。我们引入一种基于投影的奖励模型,用于 RL 策略训练,该模型由视觉语言模型(VLM)监督,使用人类引导的物体投影关系作为提示,同时通过专家演示进一步微调策略。总体而言,本工作关注仿真环境的构建和基于 RL 的策略训练,最终实现可靠机器人控制策略在真实场景中的部署。

关键词

引用

@article{arxiv.2504.20520,
  title  = {PRISM: Projection-based Reward Integration for Scene-Aware Real-to-Sim-to-Real Transfer with Few Demonstrations},
  author = {Haowen Sun and Han Wang and Chengzhong Ma and Shaolong Zhang and Jiawei Ye and Xingyu Chen and Xuguang Lan},
  journal= {arXiv preprint arXiv:2504.20520},
  year   = {2025}
}