中文

基于动作引导的3D功能分割数据生成

计算机视觉与模式识别 2026-04-07 v2

摘要

3D功能分割旨在识别3D场景中用于执行用自然语言描述的动作所需的交互元素(例如,用句子"打开靠近床头的柜子的第二个抽屉"中的抽屉柜把手)。进展受限于稀缺的标注真实数据,因为收集和标记精细的3D掩码代价高昂。为此,我们引入SynthFun3D——首个直接从动作描述生成3D功能分割数据的方法。给定动作描述,SynthFun3D通过检索具有部件级别注释的大规模资产库中的物体,并在空间和语义约束下进行排列来构建合理的3D场景。SynthFun3D渲染多视角图像并自动识别目标功能元素,生成精确的 ground-truth 掩码,无需人工标注。我们通过训练基于视觉语言模型的3D功能分割模型,展示了所生成数据的有效性。将合成数据与真实数据混合训练,相较于仅使用真实数据训练,分别在mAP、mAR和mIoU上提升了+2.2、+6.3和+5.7。这表明,动作引导的合成数据生成为3D功能理解提供了可扩展且高效的补充手段。项目页面: tev-fbk.github.io/synthfun3d。

关键词

引用

@article{arxiv.2511.23230,
  title  = {Action-guided generation of 3D functionality segmentation data},
  author = {Jaime Corsetti and Francesco Giuliari and Davide Boscaini and Pedro Hermosilla and Andrea Pilzer and Guofeng Mei and Alexandros Delitzas and Francis Engelmann and Fabio Poiesi},
  journal= {arXiv preprint arXiv:2511.23230},
  year   = {2026}
}

备注

Accepted at CVPR 2026 GenRecon3D workshop. 17 pages, 8 figures, 1 table