Neural Assembler:学习从多视图图像生成细粒度机器人组装指令
计算机视觉与模式识别
2024-04-26 v1 机器人学
摘要
图像引导的对象组装是计算机视觉中一个新兴的研究课题。本文提出一项新任务:将结构3D模型(例如,使用从3D对象库中提取的构建块构建的模型)的多视图图像转换为可由机械臂执行的详细组装指令序列。为复制目标3D模型而输入多视图图像的模型必须处理多个子任务,包括识别用于构建3D模型的各个组件、估计每个组件的几何姿态,以及推导出符合物理规则的可行组装顺序。建立多视图图像与3D对象之间准确的2D-3D对应关系在技术上具有挑战性。为此,我们提出一种端到端模型,称为Neural Assembler。该模型学习一个对象图,其中每个顶点表示从图像中识别的组件,边指定3D模型的拓扑结构,从而能够推导出组装计划。我们为此任务建立了基准,并对Neural Assembler和替代方案进行了全面的实证评估。实验清楚地证明了Neural Assembler的优越性。
引用
@article{arxiv.2404.16423,
title = {Neural Assembler: Learning to Generate Fine-Grained Robotic Assembly Instructions from Multi-View Images},
author = {Hongyu Yan and Yadong Mu},
journal= {arXiv preprint arXiv:2404.16423},
year = {2024}
}