中文

高斯掩码自编码器

计算机视觉与模式识别 2025-01-07 v1 人工智能

摘要

本文探讨了基于高斯溅写(Gaussian Splatting)的掩码自编码器(MAE)。虽然重构式自监督学习框架如 MAE 能够学习到良好的语义抽象,但其并未针对显式的空间感知性进行训练。我们提出的方法命名为高斯掩码自编码器(Gaussian Masked Autoencoder,简称 GMAE),旨在 jointly 学习语义抽象与空间理解。类似于 MAE,GMAE 端到端地在像素空间进行图像重构,但与 MAE 不同的是,它还引入了中间的基于 3D 高斯的表示,并通过溅写技术渲染图像。我们展示了 GMAE 能够实现各种零样本学习的空间理解能力(例如:figure-ground 分割、图像分层、边缘检测等),同时保持来自 MAE 的高质量自监督表示。据我们所知,GMAE 是首次在图像表示学习框架中运用高斯原始数据,超越仅用于单场景重建的优化方法。我们认为 GMAE 将激发进一步的研究,并助力开发面向高保真视觉数据的建模技术。更多细节请参见 https://brjathu.github.io/gmae。

关键词

引用

@article{arxiv.2501.03229,
  title  = {Gaussian Masked Autoencoders},
  author = {Jathushan Rajasegaran and Xinlei Chen and Rulilong Li and Christoph Feichtenhofer and Jitendra Malik and Shiry Ginosar},
  journal= {arXiv preprint arXiv:2501.03229},
  year   = {2025}
}