基于VFM的多粒度特征校准:用于域生成化语义分割
计算机视觉与模式识别
2025-08-06 v1
摘要
域生成化语义分割(DGSS)旨在提升模型在训练时不访问目标数据的情况下的跨域泛化能力。近期进展日益依赖于视觉基础模型(VFM)通过参数高效微调策略。然而,大多数现有方法集中注意力于全局特征微调,忽略了跨特征层次的层次化适应,这对于精确的稠密预测至关重要。本文提出了多粒度特征校准(MGFC),一种新型框架,对VFM特征执行从粗到细的对齐,以增强域迁移下的鲁棒性。具体而言,MGFC首先校准粗粒度特征以捕获全局语义上下文和场景级结构。随后,通过促进类别级特征判别性来细化中粒度特征。最后通过高频空间细节增强来校准细粒度特征。通过进行层次化和粒度感知的校准,MGFC有效地将VFM的泛化优势转化为DGSS任务的域特定能力。大量实验在基准数据集上表明,我们的方法优于状态的最佳DGSS方法,凸显了多粒度适应对语义分割域泛化任务的有效性。
引用
@article{arxiv.2508.03006,
title = {Seeing It Before It Happens: In-Generation NSFW Detection for Diffusion-Based Text-to-Image Models},
author = {Fan Yang and Yihao Huang and Jiayi Zhu and Ling Shi and Geguang Pu and Jin Song Dong and Kailong Wang},
journal= {arXiv preprint arXiv:2508.03006},
year = {2025}
}
备注
8 pages