面向长尾图像分类的多尺度因果干预增强视觉转换器
计算机视觉与模式识别
2025-05-14 v1
摘要
因果推断已成为缓解长尾分类的有前景方法,通过处理由类别不平衡引入的偏差。然而,随着高级主干模型从卷积神经网络(CNN)向视觉转换器(ViT)发展,现有的因果模型可能无法实现预期的性能提升。本文探讨了现有因果模型对 CNN 和 ViT 变体的影响,指出 ViT 的全局特征表示使得因果方法难以建模细粒度特征与预测之间的关联,这导致在视觉外观相似的尾部类别分类困难。为此,本文提出了 TSCNet,这是一种两阶段因果建模方法,通过多尺度因果干预发现细粒度因果关联。具体而言,在层次化因果表示学习阶段(HCRL),它将背景与物体解耦,在补丁和特征级别应用后门干预,以防止模型使用与类别无关的区域来推断标签,从而增强细粒度因果表示。在反事实逻辑偏置校准阶段(CLBC),它通过自适应构建反事实平衡数据分布来细化模型决策边界,以消除由数据分布引起的逻辑偏置。在 various长尾基准测试上进行的大量实验表明,所提出的 TSCNet 能够消除由数据不平衡引入的多种偏差,显著优于现有方法。
引用
@article{arxiv.2505.08173,
title = {Empowering Vision Transformers with Multi-Scale Causal Intervention for Long-Tailed Image Classification},
author = {Xiaoshuo Yan and Zhaochuan Li and Lei Meng and Zhuang Qi and Wei Wu and Zixuan Li and Xiangxu Meng},
journal= {arXiv preprint arXiv:2505.08173},
year = {2025}
}