中文

在极端视觉基础模型时代重审偏振图形

计算机视觉与模式识别 2026-03-06 v1

摘要

我们表明,随着偏振线索,一个在小数据集上训练的轻量级模型可以超过RGB-only视觉基础模型(VFMs)在单次物体级表面法线估计中的性能。由于偏振与表面几何之间存在强烈的物理关系,偏振图形(SfP)长期以来受到广泛研究。与此同时,受规模定律驱动,最近在大数据集上训练的RGB-only VFMs取得了令人瞩目的性能,并超过了现有的SfP方法。这一局面引发了关于偏振线索必要性的疑问,这些线索需要专业硬件且训练数据有限。我们认为,现有SfP方法的性能较差并不源于偏振模态本身,而是源于领域差距。这些领域差距主要来自两个来源:首先,现有的合成数据集使用有限且不真实的3D物体,具有简单几何和随机纹理图,这些纹理图不匹配 underlying shapes。其次,真实世界的偏振信号常受到传感器噪声的影响,在训练时未能很好地建模。为解决第一个问题,我们使用1,954个3D扫描的真实世界物体渲染了高质量的偏振数据集。我们进一步采用预训练的DINOv3先验知识来提高对未见物体的泛化能力。为解决第二个问题,我们引入了面向偏振传感器的数据增强,更贴近真实世界条件。在仅使用4万个训练场景的情况下,我们的方法显著优于最新的SfP方法和RGB-only VFMs。广泛的实验表明,偏振线索可实现训练数据的33倍减少或模型参数的8倍减少,同时仍能实现优于RGB-only对手的性能。

关键词

引用

@article{arxiv.2603.04817,
  title  = {Revisiting Shape from Polarization in the Era of Vision Foundation Models},
  author = {Chenhao Li and Taishi Ono and Takeshi Uemori and Yusuke Moriuchi},
  journal= {arXiv preprint arXiv:2603.04817},
  year   = {2026}
}