中文

EVA:在硬注意力视觉模型中桥接性能与人类对齐的图像分类

计算机视觉与模式识别 2026-03-31 v1

摘要

纯粹为分类准确率优化视觉模型可能施加对齐代价,损害类人扫描路径并限制可解释性。我们引入EVA,一个受神经科学启发的硬注意力机制测试平台,使性能-类人性权衡变得明确且可调节。EVA使用基于CNN的特征提取器和最小化中央凹-周边表示采样少量顺序注视,并通过方差控制和自适应门控来稳定和调节注意力动态。EVA使用标准分类目标进行训练,无需注视监督。在具有密集人类注视标注的CIFAR-10上,EVA在DTW、NSS等已建立指标下提升了扫描路径对齐,同时保持了有竞争力的准确率。消融实验表明,基于CNN的特征提取驱动准确率但抑制类人性,而方差控制和门控以最小的性能损失恢复了类人对齐的轨迹。我们进一步验证了EVA在ImageNet-100上的可扩展性,并在COCO-Search18上评估扫描路径对齐(无COCO-Search18注视监督或微调),其中EVA在自然场景中产生了类人扫描路径且无需额外训练。总体而言,EVA为可信赖的、可人类解释的活动视觉提供了一个原则性框架。

关键词

引用

@article{arxiv.2603.27340,
  title  = {EVA: Bridging Performance and Human Alignment in Hard-Attention Vision Models for Image Classification},
  author = {Pengcheng Pan and Yonekura Shogo and Kuniyoshi Yasuo},
  journal= {arXiv preprint arXiv:2603.27340},
  year   = {2026}
}