中文

SEAR:视觉几何变换器在 RGB+热成像 3D 重建中的简单高效适配

计算机视觉与模式识别 2026-03-20 v1

摘要

基础前馈视觉几何模型通过从大规模 RGB 数据集中学习强大的场景先验,能够实现精确高效的相机位姿估计和场景重建。然而,当应用于混合传感模态(如 RGB-热成像 RGB-T 图像)时,其有效性显著下降。我们观察到,虽然在 RGB 数据上预训练的视觉几何基础变换器在热成像-only 重建中泛化良好,但在联合处理 RGB 和热成像模态时难以对齐二者。为解决此问题,我们提出 SEAR,一种简单而高效的微调策略,将预训练的几何变换器适配至多模态 RGB-T 输入。尽管在相对较小的 RGB-T 数据集上训练,我们的方法在 3D 重建和相机位姿估计方面显著优于最先进方法,在所有指标上均取得显著提升(例如 AUC@30 提升超过 29%),并在推理时间几乎无额外开销的情况下实现了模态间更高的细节和一致性。值得注意的是,SEAR 即使在具有挑战性的条件下(如低光照和浓密烟雾)也能实现可靠的多模态位姿估计和重建。我们通过广泛的消融研究验证了架构,展示了模型如何对齐两种模态。此外,我们引入了一个新数据集,包含在不同时间、视角和光照条件下采集的 RGB 和热成像序列,为未来多模态 3D 场景重建工作提供了稳健的基准。代码和模型在 https://www.github.com/Schindler-EPFL-Lab/SEAR 公开发布。

关键词

引用

@article{arxiv.2603.18774,
  title  = {SEAR: Simple and Efficient Adaptation of Visual Geometric Transformers for RGB+Thermal 3D Reconstruction},
  author = {Vsevolod Skorokhodov and Chenghao Xu and Shuo Sun and Olga Fink and Malcolm Mielle},
  journal= {arXiv preprint arXiv:2603.18774},
  year   = {2026}
}