基于序列生成图像增强的细粒度视觉分类方法
计算机视觉与模式识别
2024-12-10 v1
摘要
在细粒度视觉分类(FGVC)中,区分高度相似的子类别仍然是一个巨大的挑战,往往需要具备广泛变异性的 数据集。获取和标注此类 FGVC 数据集具有显著难度和高成本,需要专业知识来识别彼此紧密相关类别之间的细微差异。我们的研究引入了采用序列潜在扩散模型(SLDM)的新方法,用于增强 FGVC 数据集,称为序列生成图像增强(SGIA)。该方法具有独特的桥接迁移学习(BTL)过程,旨在最小化真实数据与合成增强数据之间的域间差距。该方法在生成更真实的图像样本方面显著优于现有方法,提供多样化的姿态变换,这些变换超越传统刚性变换和风格变化的生成式数据增强。我们在各种数据集、模型和训练策略上演示了增强后数据集的有效性,尤其在少样本学习场景中。我们的工作在三个 FGVC 数据集的基准测试中超过了传统图像增强技术,展示了卓越的真实性、变异性和表征质量。我们的工作设定了新的基准,并在 CUB-200-2011 数据集的分类准确率上超过前一最先进模型 0.5%,并推动了生成模型在 FGVC 数据增强中的应用。
引用
@article{arxiv.2412.06138,
title = {SGIA: Enhancing Fine-Grained Visual Classification with Sequence Generative Image Augmentation},
author = {Qiyu Liao and Xin Yuan and Min Xu and Dadong Wang},
journal= {arXiv preprint arXiv:2412.06138},
year = {2024}
}
备注
13 pages, 5 figures