Causal-Tune:从视觉基础模型中挖掘因果因素以实现领域泛化语义分割
计算机视觉与模式识别
2025-12-19 v1
摘要
利用少量参数微调视觉基础模型(VFMs)在领域泛化语义分割(DGSS)中已展现出显著性能。大多数现有工作要么训练轻量级适配器,要么细化中间特征以在未见领域上获得更好的泛化。然而,它们都忽视了长期预训练的 VFMs 经常表现出伪影,这些伪影阻碍了有价值表征的利用,最终降低了 DGSS 性能。受因果机制启发,我们观察到这些伪影与非因果因素相关,它们通常位于 VFM 频谱的低频和高频分量中。在本文中,我们明确考察了 VFMs 中特征的因果和非因果因素,并提出了一种简单而有效的方法来识别和分离它们,从而实现更鲁棒的领域泛化。具体而言,我们提出了 Causal-Tune,一种旨在从 VFMs 特征中提取因果因素并抑制非因果因素的新型微调策略。首先,我们使用离散余弦变换(DCT)从每一层提取特征的频谱。然后应用高斯带通滤波器将频谱分离为因果和非因果分量。为进一步细化因果分量,我们引入了一组在频域中运作的因果感知可学习令牌,而非因果分量则被丢弃。最后,经过细化的特征通过逆 DCT 转换回空间域并传递给下一层。在各种跨域任务上进行的广泛实验证明了 Causal-Tune 的有效性。特别地,我们的方法在恶劣天气条件下取得了优越性能,在雪条件下相比基线将 mIoU 提高了 +4.8%。
引用
@article{arxiv.2512.16567,
title = {Causal-Tune: Mining Causal Factors from Vision Foundation Models for Domain Generalized Semantic Segmentation},
author = {Yin Zhang and Yongqiang Zhang and Yaoyue Zheng and Bogdan Raducanu and Dan Liu},
journal= {arXiv preprint arXiv:2512.16567},
year = {2025}
}
备注
Accepted by AAAI 2026