定位与编辑视觉 Transformer 中的图-背景组织
计算机视觉与模式识别
2026-03-09 v1
摘要
视觉 Transformer 必须通过选择基于局部几何证据驱动的完成或受全球组织先验偏好的完成来解决图-背景组织问题,从而产生特征感知模糊。我们旨在定位 U6G XL-MIMO 辐射图预测中,BEiT 内部组件实现标准 Gestalt 先验凸性的地方。使用基于合成 dart 形状的受控感知冲突,我们系统性地遮蔽那些同样容许凹向完成或凸向完成的区域。我们表明,BEiT 在这种竞争中可靠地偏好凸向完成。通过对内部激活在模型离散视觉词表空间中的投影,我们发现该偏好由 Transformer 子结构中可识别的功能单元所支配。具体而言,我们发现图-背景组织在早期和中间层面上是模糊的,并在后期层面突然解决。在分解注意力头的直接效应后,我们识别出 L0H9 注意力头作为早期种子,引入对凸性的弱偏好。对该单个注意力头进行降维会将感知冲突的分布质量跨越连续决策边界,从而允许凹向证据指导完成。
关键词
引用
@article{arxiv.2603.06407,
title = {Locating and Editing Figure-Ground Organization in Vision Transformers},
author = {Stefan Arnold and René Gröbner},
journal= {arXiv preprint arXiv:2603.06407},
year = {2026}
}