中文

ASCENT-ViT:基于注意力的尺度感知概念学习框架用于提升视觉Transformer的对齐效果

计算机视觉与模式识别 2025-02-05 v2 机器学习

摘要

随着Vision Transformer (ViT)在敏感视觉应用中的广泛采用,亟需提高可解释性。这导致了将这些模型与 carefully 注释的抽象、人类可理解的语义实体——概念进行 forward 对齐的努力。概念为模型预测提供全局解读,并可被领域专家快速理解和干预。目前大多数研究致力于设计不包含 foundation 模型(例如归纳偏差、尺度不变性等)在训练期间的模型agnostic、即插即用的通用概念基于解释模块。为缓解这一问题,本文提出ASCENT-ViT,一种基于注意力的概念学习框架,有效地从多尺度特征金字塔和 ViT patch 表示中构造尺度和位置感知的表示。进一步,这些表示通过注意力矩阵与概念注释对齐——该矩阵包含空间和全局(语义)概念。ASCENT-ViT可作为标准 ViT 骨干网络的分类头,用于提高预测性能并实现准确且稳健的概念解释。在包括三个广泛使用的基准数据集(CUB、Pascal APY、Concept-MNIST)和2个真实世界数据集(AWA2、KITS)上的实验表明其有效性。

关键词

引用

@article{arxiv.2501.09221,
  title  = {ASCENT-ViT: Attention-based Scale-aware Concept Learning Framework for Enhanced Alignment in Vision Transformers},
  author = {Sanchit Sinha and Guangzhi Xiong and Aidong Zhang},
  journal= {arXiv preprint arXiv:2501.09221},
  year   = {2025}
}