PEEK:用于机器人操纵策略零样本泛化的引导与最小图像表示
机器人学
2025-09-24 v1 人工智能
机器学习
摘要
机器人操纵策略常因必须同时学习注意力位置、动作选择以及执行方式而难以泛化。我们认为,关于注意力位置与动作选择的高层次推理可以 offloading 给视觉-语言模型(VLM),而将执行细节留给策略网络。我们提出了PEEK(Policy-agnostic Extraction of Essential Keypoints),通过 fine-tune VLM 以预测统一的基于点的中间表示:1. 指定机械臂末端执行器路径的动作指示,2. 指示注意力聚焦的任务相关掩码。这些注释直接叠加在机器人观测图像上,使表示与策略无关且可跨架构迁移。为实现可扩展训练,我们引入了自动注释流水线,生成覆盖20多个机器人数据集、9种机械臂 embodiment 的标注数据。在实际测试中,PEEK consistently 提升了零样本泛化性能,包括3D策略仅用仿真训练即可实现41.4x的实际性能提升,大型VAs和小型操纵策略都实现了2-3.5倍的提升。通过让VLM承担语义与视觉复杂度,PEEK为操纵策略提供了必要的最小线索——注意力位置、动作内容与执行方式。网站地址:https://peek-robot.github.io/。
引用
@article{arxiv.2509.18282,
title = {PEEK: Guiding and Minimal Image Representations for Zero-Shot Generalization of Robot Manipulation Policies},
author = {Jesse Zhang and Marius Memmel and Kevin Kim and Dieter Fox and Jesse Thomason and Fabio Ramos and Erdem Bıyık and Abhishek Gupta and Anqi Li},
journal= {arXiv preprint arXiv:2509.18282},
year = {2025}
}
备注
11 pages