中文

Rein++:面向语义分割的视觉基础模型高效泛化与适应

计算机视觉与模式识别 2025-08-05 v1

摘要

视觉基础模型(VFM)在计算机视觉任务中取得了显著的成功。然而,其在语义分割中的应用受到两个显著挑战的制约:(1)数据规模差异,因分割数据集通常远小于用于VFM预训练的数据;(2)域分布偏移,实际中的分割场景具有多样性且在预训练期间常被低估。为克服这些限制,我们提出了Rein++,一种高效的VFM基于分割框架,展示了在有限数据上的优越泛化能力,并能有效适应多样化无标签场景。具体而言,Rein++包含域泛化解决方案Rein-G和域适应解决方案Rein-A。Rein-G引入一组可训练的、实例感知的标记,有效细化VFM的特征以适应分割任务。这种参数高效的方法微调了不到1%的主干网络参数,实现了稳健的泛化。基于Rein-G,Rein-A在实例和logit级别进行无监督域适应,以缓解域偏移。此外,它集成了一个语义传递模块,利用分段任何模型的类无感知能力来增强目标域中的边界细节。Rein++管道首先在源域(例如白天场景)上学习可泛化模型,然后在多个目标域(例如夜间场景)中进行适应,无需任何目标标签。广泛的实验表明,Rein++在高效训练下显著优于最先进的方法,凸显其作为大型参数模型(甚至是亿级参数模型)的高效、泛化和适应分割解决方案的作用。代码已公开:https://github.com/wloves/Rein。

关键词

引用

@article{arxiv.2508.01667,
  title  = {Rein++: Efficient Generalization and Adaptation for Semantic Segmentation with Vision Foundation Models},
  author = {Zhixiang Wei and Xiaoxiao Ma and Ruishen Yan and Tao Tu and Huaian Chen and Jinjin Zheng and Yi Jin and Enhong Chen},
  journal= {arXiv preprint arXiv:2508.01667},
  year   = {2025}
}