Gaslight,Gatekeep,V1-V3:早期视觉皮层对齐可抵御视觉-语言模型的顺从操纵
计算机视觉与模式识别
2026-04-16 v1 人工智能
摘要
视觉-语言模型正在高风险场景中部署,但其对顺从操纵的脆弱性尚不完全了解,尤其是涉及这些模型内部表示方式的问题。那些其视觉表示更贴近人类神经处理的模型是否也更抵御对抗性压力尚存未知问题,具有神经科学和 AI 安全等多方面的意义。我们通过评估 12 个开源权重视觉-语言模型(跨越 6 个架构家族,参数范围为 256M--10B),在两个维度上进行研究:脑对齐度,通过预测来自 Natural Scenes Dataset 的 fMRI 响应(覆盖 8 名受试者和 6 个视觉皮层兴趣区域);顺从程度,通过 76,800 组双轮次欺骗提示(涵盖 5 类和 10 个难度等级)进行测量。兴趣区域分析显示,V1--V3 早期视觉皮层的对齐是顺从性的可靠负预测因子(,BAg 95% 置信区间 ),所有 12 项留一法相关均为负,且最强效果出现在否认存在攻击(,)。这种解剖学特异的关系在更高阶的类别选择性区域中不存在,表明忠实的低级视觉编码为视觉-语言模型提供了抵御对抗性语言干扰的可衡量锚点。我们在 \href{https://github.com/aryashah2k/Gaslight-Gatekeep-Sycophantic-Manipulation}{GitHub} 上发布代码,并在 \href{https://huggingface.co/datasets/aryashah00/Gaslight-Gatekeep-V1-V3}{Hugging Face} 上发布数据集。
引用
@article{arxiv.2604.13803,
title = {Gaslight, Gatekeep, V1-V3: Early Visual Cortex Alignment Shields Vision-Language Models from Sycophantic Manipulation},
author = {Arya Shah and Vaibhav Tripathi and Mayank Singh and Chaklam Silpasuwanchai},
journal= {arXiv preprint arXiv:2604.13803},
year = {2026}
}
备注
28 pages, 9 figures, 13 tables