更强、更少、更优:利用视觉基础模型进行领域泛化语义分割
计算机视觉与模式识别
2024-04-19 v5
摘要
在本文中,我们首先评估并利用各种视觉基础模型(VFM)在领域泛化语义分割(DGSS)中的表现。受“利用更强的预训练模型和更少的可训练参数以获得更优的泛化能力”这一动机驱动,我们引入了一种鲁棒的微调方法,即Rein,以参数高效地利用VFM进行DGSS。基于一组可训练令牌,每个令牌链接到不同的实例,Rein精确地细化并将特征图从骨干网络的每一层转发到下一层。这个过程为单张图像中的不同类别产生不同的细化。凭借更少的可训练参数,Rein高效地微调VFM以完成DGSS任务,令人惊讶地超越了全参数微调。在各种设置下的广泛实验表明,Rein显著优于最先进的方法。值得注意的是,仅在冻结的骨干网络中添加额外的1%可训练参数,Rein在Cityscapes上达到了78.4%的mIoU,而无需访问任何真实城市场景数据集。代码可在https://github.com/w1oves/Rein.git获取。
引用
@article{arxiv.2312.04265,
title = {Stronger, Fewer, & Superior: Harnessing Vision Foundation Models for Domain Generalized Semantic Segmentation},
author = {Zhixiang Wei and Lin Chen and Yi Jin and Xiaoxiao Ma and Tianle Liu and Pengyang Ling and Ben Wang and Huaian Chen and Jinjin Zheng},
journal= {arXiv preprint arXiv:2312.04265},
year = {2024}
}