如何对语义分割的视觉基础模型进行基准测试?
摘要
最近的视觉基础模型(VFM)在各种任务中表现出色,但需要监督微调才能有效执行语义分割任务。对其性能进行基准测试对于选择当前模型和指导该任务的未来模型开发至关重要。缺乏标准化基准使得比较变得复杂。因此,本文的主要目标是研究如何对VFM进行语义分割的基准测试。为此,我们在不同设置下对多种VFM进行微调,并评估各个设置对性能排名和训练时间的影响。基于结果,建议使用16x16补丁大小和线性解码器对VFM的ViT-B变体进行微调,因为这些设置能够代表使用更大模型、更先进解码器和更小补丁大小的情况,同时将训练时间减少13倍以上。还建议使用多个数据集进行训练和评估,因为跨数据集和领域转移的性能排名会发生变化。线性探测(某些VFM的常见做法)不被推荐,因为它不能代表端到端微调。本文推荐的基准测试设置能够对VFM在语义分割中的性能进行分析。此类分析的结果表明,基于可提示分割的预训练并无益处,而具有抽象表示的掩码图像建模(MIM)至关重要,甚至比使用的监督类型更为重要。用于高效微调VFM进行语义分割的代码可通过项目页面访问:https://tue-mps.github.io/benchmark-vfm-ss/。
引用
@article{arxiv.2404.12172,
title = {How to Benchmark Vision Foundation Models for Semantic Segmentation?},
author = {Tommie Kerssies and Daan de Geus and Gijs Dubbelman},
journal= {arXiv preprint arXiv:2404.12172},
year = {2024}
}
备注
CVPR 2024 Workshop Proceedings for the Second Workshop on Foundation Models. v2 updates image normalization preprocessing for linear probing with EVA-02, EVA-02-CLIP, SigLIP, DFN (the impact on end-to-end fine-tuning is negligible; no changes made)