SparseDFF:用于一次性灵巧操作的稀疏视角特征蒸馏
机器人学
2024-03-19 v2 计算机视觉与模式识别
摘要
人类展现出在形状、位姿和外观各异的物体间迁移操作能力的卓越技巧,这种能力根植于他们对不同实例间语义对应关系的理解。为使机器人具备类似的高层理解能力,我们提出 SparseDFF,一种利用大型2D视觉模型从稀疏 RGBD 图像中提取语义特征的新型3D场景 DFF,该领域尽管与许多固定相机设置下的任务相关,但研究有限。SparseDFF 生成视角一致的3D DFF,通过将图像特征映射到3D点云,实现灵巧操作的高效一次性学习。SparseDFF 的核心是一个特征精炼网络,通过视角间的对比损失和点剪枝机制进行优化以保证特征连续性。这有助于最小化关于末端执行器参数的特征差异,从而桥接演示与目标操作。在配备灵巧手的真实场景中得到验证,SparseDFF 在操控刚性和可变形物体方面均有效,展示出跨物体和场景变化的显著泛化能力。
引用
@article{arxiv.2310.16838,
title = {SparseDFF: Sparse-View Feature Distillation for One-Shot Dexterous Manipulation},
author = {Qianxu Wang and Haotong Zhang and Congyue Deng and Yang You and Hao Dong and Yixin Zhu and Leonidas Guibas},
journal= {arXiv preprint arXiv:2310.16838},
year = {2024}
}