中文

超越高斯瓶颈:视觉Transformer特征空间的拓扑对齐编码

计算机视觉与模式识别 2026-05-01 v1 机器学习

摘要

现代视觉世界建模系统日益依赖高容量架构和大规模数据来生成合理的运动,但它们往往无法保留底层的三维几何或物理上一致的相机动力学。一个关键限制不仅在于模型容量,还在于用于编码几何结构的潜在表示。我们提出了S2^2VAE,一个几何优先的潜在学习框架,专注于压缩和表示场景的潜在三维状态,包括相机运动、深度和点级结构,而不仅仅是建模外观。基于视觉几何基础Transformer(VGGT)的表示,我们引入了一种新型变分自编码器,使用幂球面潜在分布的乘积,在瓶颈处显式地强制超球面结构,以在强压缩下保留方向和几何语义。在深度估计、相机姿态恢复和点云重建任务中,我们展示了几何对齐的超球面潜在表示始终优于传统的高斯瓶颈,尤其是在高压缩率下。我们的结果凸显了潜在几何作为物理基础视觉和世界模型的一流设计选择。

关键词

引用

@article{arxiv.2604.28122,
  title  = {Beyond Gaussian Bottlenecks: Topologically Aligned Encoding of Vision-Transformer Feature Spaces},
  author = {Andrew Bond and Ilkin Umut Melanlioglu and Erkut Erdem and Aykut Erdem},
  journal= {arXiv preprint arXiv:2604.28122},
  year   = {2026}
}

备注

16 pages, 10 figures