中文

视觉语言假设

计算机视觉与模式识别 2026-01-01 v2 机器学习

摘要

我们从结构和拓扑学的角度研究视觉表征学习。我们从一个假设开始:视觉理解预设了一种视觉的语义语言,其中许多感知观察对应于少数离散语义状态。结合表示学习中关于可迁移性和抽象性的广泛假设,这一假设意味着视觉观察空间必须以纤维丛般的结构组织,其中杂质变异占据纤维,而语义对应于商基空间。从这种结构中,我们推导出两个理论后果。首先,语义商 X/GX/G 不是 XX 的子流形,不能通过光滑变形获得,语义不变性需要一种非同胚的、判别性的目标,例如标签监督、跨实例识别或多模态对齐,以提供显式的语义等价性。其次,我们展示,近似商也对模型架构提出结构要求。语义抽象不仅需要外部语义目标,还需要一种能够支持拓扑变化的表示机制:一种在几何上首先扩张以分离结构,然后折叠以形成离散语义区域的“扩张-捕获”过程。我们强调,这些结果是解释性的而非命令性的:该框架提供了一个拓扑学视角,与大规模判别性和多模态模型中观察到的经验规律以及统计学习理论中的经典原则相吻合。

关键词

引用

@article{arxiv.2512.23335,
  title  = {Visual Language Hypothesis},
  author = {Xiu Li},
  journal= {arXiv preprint arXiv:2512.23335},
  year   = {2026}
}