中文

Transformer 图像嵌入的内在极限:非可解空间推理

计算机视觉与模式识别 2026-05-28 v2 人工智能 计算复杂性

摘要

Vision Transformers (ViTs) 在语义识别方面表现出色,但在空间推理任务(如心理旋转)中存在系统性失败。虽然常归因于数据规模,但本工作认为限制源自于体系结构的内在电路复杂度。通过将空间理解形式化为学习群同态问题——即潜在嵌入保留作用于图像的物理变换的代数结构——我们识别出一个基本计算瓶颈。具体而言,对于非可解群(如 SO(3)\mathrm{SO}(3)),维持此类结构保持嵌入的下界由单词问题给出,而该问题为 NC1\mathsf{NC^1}-complete。相比之下,常数深度 ViTs 在多项式精度下严格受限于复杂度类 TC0\mathsf{TC^0}。在标准猜想 TC0NC1\mathsf{TC^0} \subsetneq \mathsf{NC^1} 下,出现复杂度边界:常数深度体系缺乏捕获非可解空间结构所需的逻辑深度,无法在单次前向传递中实现。为验证理论差距,我们提出了 Latent Space Algebra (LSA) 基准测试,该基准显示出 ViT 表示在非可解任务的组成深度增加时显著退化。

关键词

引用

@article{arxiv.2601.03048,
  title  = {On the Intrinsic Limits of Transformer Image Embeddings in Non-Solvable Spatial Reasoning},
  author = {Siyi Lyu and Quan Liu and Feng Yan},
  journal= {arXiv preprint arXiv:2601.03048},
  year   = {2026}
}