GViT:将图像表示为高斯用于视觉识别
计算机视觉与模式识别
2025-07-01 v1 机器学习
摘要
我们提出GVIT,一种分类框架,抛弃传统的像素或 patch 网格输入表示,采用少量可学习的二维高斯。每张图像编码为少数百个高斯,其位置、尺度、方向、颜色和不透明度与ViT分类器一起优化。我们复用分类器梯度作为建设性指导,将高斯引导至类别关键区域,同时可微分渲染器优化图像重建损失。我们展示,结合我们GVIT指导的二维高斯输入表示,使用相对标准的ViT架构,可接近传统基于 patch的ViT性能,在ViT-B架构下在ImageNet-1k上达到76.9%的top-1准确率。
引用
@article{arxiv.2506.23532,
title = {GViT: Representing Images as Gaussians for Visual Recognition},
author = {Jefferson Hernandez and Ruozhen He and Guha Balakrishnan and Alexander C. Berg and Vicente Ordonez},
journal= {arXiv preprint arXiv:2506.23532},
year = {2025}
}