强大而简单:基于 CLIP 迁移学习的领域泛化密集感知基线
计算机视觉与模式识别
2024-12-12 v4 人工智能
机器学习
摘要
对于基于深度神经网络(DNN)的感知而言,领域泛化(DG)仍然是一个重大挑战,其中领域偏移由合成数据、光照、天气或位置变化引起。视觉-语言模型(VLM)在泛化能力方面迈出了一大步,并已被应用于各种任务。最近,首批方法利用 VLM 进行领域泛化分割和目标检测,并获得了强大的泛化能力。然而,所有这些方法都依赖于复杂的模块、特征增强框架或额外模型。令人惊讶的是,与此相反,我们发现对视觉-语言预训练模型进行简单的微调,在应用极其简单的同时,能产生具有竞争力甚至更强的泛化结果。此外,我们发现视觉-语言预训练始终比以往仅视觉预训练的标准提供更好的泛化能力。这挑战了使用基于 ImageNet 的迁移学习进行领域泛化的标准。在合成数据集 GTA5 上进行训练时,对视觉-语言预训练模型进行全微调能够达到领域泛化 SOTA。此外,我们在一个新的合成到真实基准上针对目标检测证实了这一观察结果。我们通过在流行的 Cityscapes-to-ACDC 基准上达到 77.9% mIoU,进一步获得了卓越的泛化能力。我们还发现了改进的领域内泛化,在 Cityscapes 测试集上达到 86.4% mIoU 的改进 SOTA,位列排行榜第一名。
引用
@article{arxiv.2312.02021,
title = {Strong but simple: A Baseline for Domain Generalized Dense Perception by CLIP-based Transfer Learning},
author = {Christoph Hümmer and Manuel Schwonberg and Liangwei Zhou and Hu Cao and Alois Knoll and Hanno Gottschalk},
journal= {arXiv preprint arXiv:2312.02021},
year = {2024}
}
备注
Accepted to ACCV 2024; Project Page: https://vltseg.github.io/