UniMatch V2:推进半监督语义分割的极限
计算机视觉与模式识别
2025-01-10 v2
摘要
半监督语义分割(SSS)旨在从廉价的无标签图像中学习丰富的视觉知识,以提升语义分割能力。尽管近期研究在放大弱到强一致性正则化实践方面取得了显著进展,但后续研究通常遵循类似的流程并提出各种精细设计。尽管已取得进展,但令人惊讶的是,在众多强大视觉模型蓬勃发展的时代,几乎所有SSS工作仍停留在使用过时的ResNet编码器进行小规模ImageNet-1K预训练,并在简单的数据集(如Pascal和Cityscapes)上进行评估。本文认为,有必要将SSS的基线从基于ResNet的编码器切换到更强大的ViT-based编码器(如DINOv2),这些编码器是在大规模数据上预训练的。即使使用编码器进行简单更新(甚至使用2倍更少的参数),也能带来比谨慎方法设计更大的显著性改进。建立在这个具竞争力的基线之上,我们提出了升级版和简化版的UniMatch V2,继承了V1中弱到强一致性的核心精神,但训练成本更低,效果更稳定地更好。此外,鉴于Pascal和Cityscapes上性能逐渐饱和,我们呼吁应关注更具挑战性的数据集,如ADE20K和COCO数据集。所有报告值的数据、模型和日志均可在 https://github.com/LiheYoung/UniMatch-V2 获取。
引用
@article{arxiv.2410.10777,
title = {UniMatch V2: Pushing the Limit of Semi-Supervised Semantic Segmentation},
author = {Lihe Yang and Zhen Zhao and Hengshuang Zhao},
journal= {arXiv preprint arXiv:2410.10777},
year = {2025}
}
备注
Accepted by TPAMI