VIHE:面向三维机器人操作的手内虚拟眼 Transformer
机器人学
2024-03-20 v2
摘要
本文提出虚拟手内眼 Transformer(Virtual In-Hand Eye Transformer, VIHE),一种通过动作感知视图渲染增强三维操作能力的新方法。VIHE 以早期阶段动作预测所生成的渲染视图为条件,在多个阶段自回归地细化动作。这些虚拟手内视图为有效识别手部正确姿态提供了强归纳偏置,尤其适用于插钉等高精度挑战性任务。在 RLBench 仿真环境的 18 项操作任务上,VIHE 取得了新的最优性能,相比现有最优模型(每任务 100 次演示)绝对提升 12%,成功率从 65% 提高到 77%。在真实场景中,VIHE 仅需少量演示即可学会操作任务,凸显其实用价值。视频与代码实现见项目网站:https://vihe-3d.github.io。
引用
@article{arxiv.2403.11461,
title = {VIHE: Virtual In-Hand Eye Transformer for 3D Robotic Manipulation},
author = {Weiyao Wang and Yutian Lei and Shiyu Jin and Gregory D. Hager and Liangjun Zhang},
journal= {arXiv preprint arXiv:2403.11461},
year = {2024}
}