中文

学习如何观察:基于视觉语言模型的认知注意力对齐

计算机视觉与模式识别 2025-09-26 v1 人工智能

摘要

卷积神经网络 (CNN) 常常通过利用浅层相关性来“作弊”,引发人们担心它们是否就正确的原因做出预测。受认知科学中注意力在稳健人类感知中作用的启发,最近的研究方法寻求使用概念基础的监督和解释规则化来引导模型注意力。然而这些技术依赖于耗时的、由专家提供的注释,限制了其可扩展性。我们提出了一个可扩展框架,利用视觉语言模型自动生成使用自然语言提示的语义注意力图。通过引入一个辅助损失,将 CNN 注意力与这些语言引导的图对齐,我们的方法促进更可靠的、认知上合理的决策,而无需手动注释。在挑战性数据集 ColoredMNIST 和 DecoyMNIST 上的实验表明,我们的方法在 ColorMNIST 上实现了最好的性能,并在 DecoyMNIST 上保持与注释密集型基线的竞争力,表明改进了泛化能力、减少了捷足之嫁的依赖,并使模型注意力更能反映人类直觉。

关键词

引用

@article{arxiv.2509.21247,
  title  = {Learning to Look: Cognitive Attention Alignment with Vision-Language Models},
  author = {Ryan L. Yang and Dipkamal Bhusal and Nidhi Rastogi},
  journal= {arXiv preprint arXiv:2509.21247},
  year   = {2025}
}

备注

7 pages, neurips workshop