中文

无预训练的全新微粒细粒度图像识别:教师引导数据增强

图形学 2026-04-14 v3

摘要

微粒细粒度图像识别 (FGIR) 旨在区分同一更广泛类别内视觉上相似的子类别,例如识别鸟类种类。虽然大多数现有 FGIR 方法依赖在大规模数据集如 ImageNet 上预训练的骨干网络,但这种依赖限制了在资源受限环境中的适应性,并阻碍了针对 FGIR 独特挑战的任务特定体系结构开发。本文通过表明完全从头训练也能实现高性能 FGIR 系统,来挑战常规对预训练模型的依赖。我们引入一种新颖的训练框架 TGDA,将数据感知增强与通过知识蒸馏实现的细粒度感知教师模型集成。该框架解锁了任务特定和硬件感知体系结构的设计,包括针对低分辨率 FGIR 的 LRNets 以及针对高效推理的 Vision Transformer 系列模型 ViTFS。广泛的在三个 FGIR 基准数据集上的实验显示,我们的方法在各种设置下(包括低分辨率和高分辨率输入)均能稳定地匹配或超越最先进的预训练方法。特别是在低分辨率设置下,LRNets 通过 TGDA 在准确率上提高最高可达 23%,同时参数数量降低最高可达 20.6 倍,FLOPs 降低显著,所需训练数据也大幅减少。同样地,ViTFS-T 能够在使用 15.3 倍更少的可训练参数的情况下匹配在 ImageNet-21k 上预训练的 ViT B-16,所需训练数据数量也降低数量级。这些结果凸显了 TGDA 作为预训练替代方案的潜力,为更高效的细粒度视觉系统铺平了道路。

关键词

引用

@article{arxiv.2507.12156,
  title  = {SmokeSVD: Smoke Reconstruction from A Single View via Progressive Novel View Synthesis and Refinement with Diffusion Models},
  author = {Chen Li and Shanshan Dong and Sheng Qiu and Jianmin Han and Yibo Zhao and Zan Gao and Taku Komura and Kemeng Huang},
  journal= {arXiv preprint arXiv:2507.12156},
  year   = {2026}
}