视觉语言模型中的冲突适应
计算机视觉与模式识别
2025-11-20 v2 计算与语言
摘要
人类认知控制的标志性特征之一是冲突适应:在高冲突试trial之后,表现出对后续高冲突试trial的改进表现。这种现象为稀缺资源——认知控制的调度提供了解释。我们使用顺序斯特鲕普任务,发现测试的12个视觉语言模型(VLM)中均表现出符合冲突适应的行为,仅有一个例外可能反映出 ceiling 效应。为理解这种行为的表征基础,我们使用稀疏自编码器(SAEs)识别InternVL 3.5 4B中与任务相关的超级节点。文本和颜色在早期和晚期层中均出现部分重叠的超级节点,其相对大小反映了人类阅读与着色命名之间自动化程度的不对称。我们进一步识别了受冲突调制的超级节点位于第24-25层,其消融显著增加斯特鲕普错误,同时对一致trial影响最小。
引用
@article{arxiv.2510.24804,
title = {Conflict Adaptation in Vision-Language Models},
author = {Xiaoyang Hu},
journal= {arXiv preprint arXiv:2510.24804},
year = {2025}
}
备注
Workshop on Interpreting Cognition in Deep Learning Models at NeurIPS 2025