中文

Img2CAD:通过 VLM 辅助条件分解从图像逆向工程 3D CAD 模型

计算机视觉与模式识别 2025-09-22 v2 图形学

摘要

从图像逆向工程 3D 计算机辅助设计 (CAD) 模型是许多下游应用(包括交互式编辑、制造、建筑、机器人等)的重要任务。该任务的难点在于 CAD 输出与图像输入之间的巨大的表征差异。CAD 模型是精确的、程序化的构造,涉及组合离散命令结构与连续属性的顺序操作,这使得学习和以端到端方式优化变得具有挑战性。同时,输入图像还带来了光谱变化和传感器噪声等固有挑战, complicating the reverse engineering process。本 work 提出了一种新的方法,将任务条件性地分解为两个子问题。首先,我们利用视觉-语言基础模型 (VLM),即微调的 Llama3.2,预测具有语义信息的全局离散基结构。其次,我们提出 TrAssembler,该方法在离散结构(带语义)条件下预测连续属性值。为支持 TrAssembler 的训练,我们进一步构建了一个来自 ShapeNet 的常见物体标注 CAD 数据集。综上所述,我们的方法和数据为从野生图像中实现 CAD 化展示了重要的初步步骤。代码和数据可在 https://github.com/qq456cvb/Img2CAD 查找。

关键词

引用

@article{arxiv.2408.01437,
  title  = {Img2CAD: Reverse Engineering 3D CAD Models from Images through VLM-Assisted Conditional Factorization},
  author = {Yang You and Mikaela Angelina Uy and Jiaqi Han and Rahul Thomas and Haotong Zhang and Yi Du and Hansheng Chen and Francis Engelmann and Suya You and Leonidas Guibas},
  journal= {arXiv preprint arXiv:2408.01437},
  year   = {2025}
}

备注

Accepted to SIGGRAPH Asia 2025