从局部线索到全局感知:自监督视觉模型中的涌现格式塔组织
计算机视觉与模式识别
2025-06-03 v1 人工智能
摘要
人类视觉利用闭合、邻近性和图形-背景分配等格式塔原则将局部线索组织成连贯的全局形式——这些功能依赖于全局空间结构。我们研究现代视觉模型是否表现出类似行为,以及在何种训练条件下这些行为会涌现。我们发现,使用掩码自编码(MAE)训练的 Vision Transformer(ViT)表现出与格式塔定律一致的激活模式,包括 illusory contour completion、凸性偏好和动态图形-背景分离。为了探究其计算基础,我们假设对全局依赖关系进行建模是产生格式塔式组织所必需的。我们引入了失真空间关系测试平台(DiSRT),用于评估对全局空间扰动的敏感性,同时保留局部纹理。使用 DiSRT,我们表明自监督模型(例如 MAE、CLIP)优于监督基线,有时甚至超越人类表现。使用 MAE 训练的 ConvNeXt 模型也表现出与格式塔兼容的表示,表明这种敏感性可以在没有注意力架构的情况下产生。然而,分类微调会降低这种能力。受生物视觉启发,我们表明 Top-K 激活稀疏机制可以恢复全局敏感性。我们的发现确定了促进或抑制格式塔式感知的训练条件,并将 DiSRT 确立为跨模型全局结构敏感性的诊断工具。
引用
@article{arxiv.2506.00718,
title = {From Local Cues to Global Percepts: Emergent Gestalt Organization in Self-Supervised Vision Models},
author = {Tianqin Li and Ziqi Wen and Leiran Song and Jun Liu and Zhi Jing and Tai Sing Lee},
journal= {arXiv preprint arXiv:2506.00718},
year = {2025}
}