中文

通过空间-语义因式分解学习稀疏视觉表征

计算机视觉与模式识别 2026-02-03 v1 人工智能 机器学习

摘要

自监督学习(SSL)面临语义理解与图像重建之间的根本冲突。高层语义 SSL(如 DINO)依赖于全球 token,这些 token 被强制为位置不变,以便进行数据增强对齐,这一过程本质上丢弃了重建所必需的空间坐标。相反,生成式 SSL(如 MAE)保留密集特征网格以进行重建,但无法产生高层抽象。我们引入 STELLAR—a一种通过将视觉特征分解为语义概念及其空间分布的低秩乘积来解决这一张力的框架。这种解�合允许我们在语义 token 上执行 DINO 风格的数据增强对齐,同时保持 localisation 矩阵中精确的空间映射,以实现像素级重建。我们演示了仅需 16 个稀疏 token 即可同时支持高质量重建(2.60 FID)和匹配密集 backbone 的语义性能(79.10% ImageNet accuracy)。我们的结果突显 STELLAR 作为一种多功能稀疏表征,能够通过战略性地分离语义身份与空间几何,弥合判别式与生成式视觉方法之间的差距。代码可在 https://aka.ms/stellar 获取。

关键词

引用

@article{arxiv.2602.01905,
  title  = {Learning Sparse Visual Representations via Spatial-Semantic Factorization},
  author = {Theodore Zhengde Zhao and Sid Kiblawi and Jianwei Yang and Naoto Usuyama and Reuben Tan and Noel C Codella and Tristan Naumann and Hoifung Poon and Mu Wei},
  journal= {arXiv preprint arXiv:2602.01905},
  year   = {2026}
}