DiffAssemble:一种用于 2D 和 3D 重组的统一图扩散模型
计算机视觉与模式识别
2024-03-01 v1
摘要
重组任务在许多领域中发挥着基础性作用,且存在多种解决特定重组问题的方法。在此背景下,我们提出一个通用的统一模型可以有效解决所有此类问题,无论输入数据类型如何(图像、3D 等)。我们介绍了 DiffAssemble,这是一种基于图神经网络 (GNN) 的架构,它利用扩散模型公式学习解决重组任务。我们的方法将集合中的元素(无论是 2D 图块还是 3D 物体碎片)视为空间图的节点。训练过程通过在元素的位置和旋转中引入噪声,并迭代地去噪以重建连贯的初始姿态来实现。DiffAssemble 在大多数 2D 和 3D 重组任务中取得了最先进 (SOTA) 的结果,并且是首个能同时解决 2D 拼图旋转和平移问题的基于学习的方法。此外,我们强调了其在运行时间上的显著减少,其速度比最快的基于优化的拼图求解方法快 11 倍。代码地址:https://github.com/IIT-PAVIS/DiffAssemble
引用
@article{arxiv.2402.19302,
title = {DiffAssemble: A Unified Graph-Diffusion Model for 2D and 3D Reassembly},
author = {Gianluca Scarpellini and Stefano Fiorini and Francesco Giuliari and Pietro Morerio and Alessio Del Bue},
journal= {arXiv preprint arXiv:2402.19302},
year = {2024}
}
备注
Accepted at CVPR2024