SEMAGIC:从野外图像学习语义一致的可变形 3D 表示
计算机视觉与模式识别
2026-05-28 v1
摘要
从单视图野外图像学习可变形 3D 对象模型,使 3D 形状重建在无监督情况下取得了令人印象深刻的效果。然而,这些模型是否捕捉到下游任务所需的语义结构仍然不明确。我们发现,尽管已有的可变形重建方法在视觉上产生符合情境的几何,但在实例之间产生不稳定的对应关系,并在语义对应基准测试上表现不佳。我们引入 SEMAGIC,一个从单视图野外图像学习语义一致可变形 3D 表示的框架。不同于将重建视为终点目标,SEMAGIC 将可变形建模作为发现类别级对应关系的机制。每个类别由一个标准模板网格和一个学习得到的变形场组成,功能类似于自动编码器,从图像特征重建实例几何,从而使顶点在不同实例之间保持一致的语义含义。通过以下两种方式在训练期间强制语义一致性:(i) 通过特征级一致性损失对齐标准网格和变形网格之间的语义特征,(ii) 采用顶点索引条件化的变形以保持跨实例的语义对应。通过显式地将几何变形与语义对齐耦合,SEMAGIC 产生的表示在类别内部变异中保持稳定的部件对应关系。实验表明,SEMAGIC 在 SPair-71k 上的语义对应性能提升了 +14.7 [email protected],证明可变形模型是有效的语义 3D 表示。
引用
@article{arxiv.2605.27938,
title = {SEMAGIC: Learning Semantically Consistent Deformable 3D Representations from In-the-Wild Images},
author = {Sky Cen and Wufei Ma and Guofeng Zhang and Alan Yuille and Adam Kortylewski},
journal= {arXiv preprint arXiv:2605.27938},
year = {2026}
}