帧挖掘:从三维点云学习机器人操作的免费午餐
机器人学
2022-10-17 v1 计算机视觉与模式识别
摘要
我们研究了输入点云坐标帧的选择如何影响从三维点云学习操作技能。存在多种坐标帧选择来归一化捕获的机器人-物体-交互点云。我们发现不同帧对智能体学习性能有深远影响,并且该趋势在各类三维骨干网络上相似。特别地,在许多任务中,末端执行器帧和目标部件帧比常用的世界帧和机器人基座帧实现了更高的训练效率,直观上是因为它们在点云跨时间步之间提供了有益的 alignment,从而可以简化视觉模块学习。此外,表现良好的帧因任务而异,并且某些任务可能受益于多个帧候选。因此我们提出 FrameMiners 以任务无关的方式自适应选择候选帧并融合其优点。在实验上,FrameMiners 在改编自 ManiSkill 和 OCRTOC 的五个全物理操作任务上达到了与最佳单帧版本相当或显著更高的性能。在不改变现有相机布置或添加额外相机的情况下,点云帧挖掘可作为一种免费午餐来改进三维操作学习。
引用
@article{arxiv.2210.07442,
title = {Frame Mining: a Free Lunch for Learning Robotic Manipulation from 3D Point Clouds},
author = {Minghua Liu and Xuanlin Li and Zhan Ling and Yangyan Li and Hao Su},
journal= {arXiv preprint arXiv:2210.07442},
year = {2022}
}
备注
Conference on Robot Learning (CoRL) 2022; Project Website: https://colin97.github.io/FrameMining/