多模态转换器中视觉有趣度的神经科学启发分析
计算机视觉与模式识别
2026-05-12 v1 人工智能
摘要
人类注意力是意识感知、记忆和决策的入口。然而,它在现代转换器模型中的作用仍大体未被探索。鉴于这些系统日益影响人们看什么、喜欢什么和购买什么,亟需探讨它们是否编码了人类兴趣的原则,或仅仅利用大规模相关性。针对这一问题的探索对于理解认知以及确保 AI 在沟通和营销中的负责任使用至关重要。为此,我们在多模态视觉语言模型 Qwen3-VL-8B 中检验了视觉有趣度的概念,采用源自大规模人类参与数据(来自照片分享平台 Flickr)的预定义常见有趣度 (CI) 评分。我们使用神经科学方法分析了视觉和语言组件中的内部表示。我们的分析表明,CI 信息可从最终层嵌入中线性解码,表明其与基于人类的视觉有趣度度量衡保持一致。维度约化和广义判别价值 (GDV) 分析表明,CI 相关隐藏表示在中间视觉转换器层中出现,并在语言模型层中逐渐变得更加可区分。使用几何、探针和稀疏自动编码器等方法衍生的概念向量在更高层中收敛,代表相似性分析亦证实了这一点。这表明在无显式监督的情况下,视觉有趣度具有稳健且结构化的编码。未来的工作将寻找出人脑动力学与转换器架构之间共享的计算原则,最终目标是揭示注意力和兴趣在生物和人造系统中产生的组织机制。
引用
@article{arxiv.2605.08188,
title = {Neuroscience-Inspired Analyses of Visual Interestingness in Multimodal Transformers},
author = {Mathis Immertreu and Fitim Abdullahu and Thomas Kinfe and Helmut Grabner and Patrick Krauss and Achim Schilling},
journal= {arXiv preprint arXiv:2605.08188},
year = {2026}
}