中文

GViT:将图像表示为高斯用于视觉识别

计算机视觉与模式识别 2025-07-01 v1 机器学习

摘要

我们提出GVIT,一种分类框架,抛弃传统的像素或 patch 网格输入表示,采用少量可学习的二维高斯。每张图像编码为少数百个高斯,其位置、尺度、方向、颜色和不透明度与ViT分类器一起优化。我们复用分类器梯度作为建设性指导,将高斯引导至类别关键区域,同时可微分渲染器优化图像重建损失。我们展示,结合我们GVIT指导的二维高斯输入表示,使用相对标准的ViT架构,可接近传统基于 patch的ViT性能,在ViT-B架构下在ImageNet-1k上达到76.9%的top-1准确率。

关键词

引用

@article{arxiv.2506.23532,
  title  = {GViT: Representing Images as Gaussians for Visual Recognition},
  author = {Jefferson Hernandez and Ruozhen He and Guha Balakrishnan and Alexander C. Berg and Vicente Ordonez},
  journal= {arXiv preprint arXiv:2506.23532},
  year   = {2025}
}