中文

更强、更少、更优:利用视觉基础模型进行领域泛化语义分割

计算机视觉与模式识别 2024-04-19 v5

摘要

在本文中,我们首先评估并利用各种视觉基础模型(VFM)在领域泛化语义分割(DGSS)中的表现。受“利用更强的预训练模型和更少的可训练参数以获得更优的泛化能力”这一动机驱动,我们引入了一种鲁棒的微调方法,即Rein,以参数高效地利用VFM进行DGSS。基于一组可训练令牌,每个令牌链接到不同的实例,Rein精确地细化并将特征图从骨干网络的每一层转发到下一层。这个过程为单张图像中的不同类别产生不同的细化。凭借更少的可训练参数,Rein高效地微调VFM以完成DGSS任务,令人惊讶地超越了全参数微调。在各种设置下的广泛实验表明,Rein显著优于最先进的方法。值得注意的是,仅在冻结的骨干网络中添加额外的1%可训练参数,Rein在Cityscapes上达到了78.4%的mIoU,而无需访问任何真实城市场景数据集。代码可在https://github.com/w1oves/Rein.git获取。

关键词

引用

@article{arxiv.2312.04265,
  title  = {Stronger, Fewer, & Superior: Harnessing Vision Foundation Models for Domain Generalized Semantic Segmentation},
  author = {Zhixiang Wei and Lin Chen and Yi Jin and Xiaoxiao Ma and Tianle Liu and Pengyang Ling and Ben Wang and Huaian Chen and Jinjin Zheng},
  journal= {arXiv preprint arXiv:2312.04265},
  year   = {2024}
}