中文

将视觉 LEGO 手册翻译为机器可执行计划

计算机视觉与模式识别 2022-07-27 v1 人工智能

摘要

我们研究将由人类设计者创建的基于图像的分步装配手册翻译为机器可解释指令的问题。我们将此问题表述为一个序列预测任务:在每一步,我们的模型读取手册,定位要添加到当前形状上的部件,并推断其 3D 位姿。该任务提出了在手册图像与真实 3D 物体之间建立 2D-3D 对应关系的挑战,以及对未见 3D 物体进行 3D 位姿估计的挑战,因为某一步中要添加的新部件可能是由先前步骤构建的物体。为应对这两个挑战,我们提出了一种新颖的基于学习的框架——手册到可执行计划网络(MEPNet),其从一系列手册图像中重建装配步骤。核心思想是将神经 2D 关键点检测模块与 2D-3D 投影算法相集成,以实现高精度预测和对未见部件的强泛化能力。MEPNet 在三个新收集的 LEGO 手册数据集和一个 Minecraft 房屋数据集上优于现有方法。

关键词

引用

@article{arxiv.2207.12572,
  title  = {Translating a Visual LEGO Manual to a Machine-Executable Plan},
  author = {Ruocheng Wang and Yunzhi Zhang and Jiayuan Mao and Chin-Yi Cheng and Jiajun Wu},
  journal= {arXiv preprint arXiv:2207.12572},
  year   = {2022}
}

备注

ECCV 2022. Project page: https://cs.stanford.edu/~rcwang/projects/lego_manual