Transformer 图像嵌入的内在极限:非可解空间推理
计算机视觉与模式识别
2026-05-28 v2 人工智能
计算复杂性
摘要
Vision Transformers (ViTs) 在语义识别方面表现出色,但在空间推理任务(如心理旋转)中存在系统性失败。虽然常归因于数据规模,但本工作认为限制源自于体系结构的内在电路复杂度。通过将空间理解形式化为学习群同态问题——即潜在嵌入保留作用于图像的物理变换的代数结构——我们识别出一个基本计算瓶颈。具体而言,对于非可解群(如 ),维持此类结构保持嵌入的下界由单词问题给出,而该问题为 -complete。相比之下,常数深度 ViTs 在多项式精度下严格受限于复杂度类 。在标准猜想 下,出现复杂度边界:常数深度体系缺乏捕获非可解空间结构所需的逻辑深度,无法在单次前向传递中实现。为验证理论差距,我们提出了 Latent Space Algebra (LSA) 基准测试,该基准显示出 ViT 表示在非可解任务的组成深度增加时显著退化。
关键词
引用
@article{arxiv.2601.03048,
title = {On the Intrinsic Limits of Transformer Image Embeddings in Non-Solvable Spatial Reasoning},
author = {Siyi Lyu and Quan Liu and Feng Yan},
journal= {arXiv preprint arXiv:2601.03048},
year = {2026}
}