Lift3D 基础策略:提升 2D 大规模预训练模型以实现稳健的 3D 机器人操控
计算机视觉与模式识别
2024-12-17 v2
摘要
3D 几何信息对操控任务至关重要,因为机器人需要感知 3D 环境、推理关于空间关系的推断,并与复杂的空间配置进行交互。最近的研究越来越关注显式提取 3D 特征,但仍面临大规模机器人 3D 数据不足以及潜在空间几何信息丢失的挑战。为此,我们提出了 Lift3D 框架,通过逐步增强 2D 基础模型中隐式和显式的 3D 机器人表示,以构建稳健的 3D 操控策略。具体而言,我们首先设计了一个任务感知的掩码自编码器,对掩码相关 affordance 区域进行掩码处理并重建深度信息,从而增强了 2D 基础模型中隐式的 3D 机器人表示。经过自监督微调后,我们引入一种 2D 模型提升策略,在输入的 3D 点云数据和 2D 模型的位置嵌入之间建立位置映射。基于该映射,Lift3D 利用 2D 基础模型直接对点云数据进行编码,借助大规模预训练知识构建显式的 3D 机器人表示,同时最小化空间信息的丢失。在实验中,Lift3D 在多个模拟基准和真实场景中一致优于以前的 state-of-the-art 方法。
引用
@article{arxiv.2411.18623,
title = {Lift3D Foundation Policy: Lifting 2D Large-Scale Pretrained Models for Robust 3D Robotic Manipulation},
author = {Yueru Jia and Jiaming Liu and Sixiang Chen and Chenyang Gu and Zhilue Wang and Longzan Luo and Lily Lee and Pengwei Wang and Zhongyuan Wang and Renrui Zhang and Shanghang Zhang},
journal= {arXiv preprint arXiv:2411.18623},
year = {2024}
}