中文

基于结构与主体保留性的细粒度分类提升

计算机视觉与模式识别 2025-02-11 v3

摘要

细粒度视觉分类(FGVC)涉及对 closely related 子类的分类。由于类与类之间的细微差异以及类内方差的增大,该任务具有较大的难度。此外,FGVC 数据集通常较小且难以收集,因此对有效的数据增强方法需求突出。近期的文本到图像扩散模型的发展为增强分类数据集提供了新的可能性。虽然这些模型已被用于生成分类任务的训练数据,但其在 FGVC 模型的完整数据集训练中的有效性仍未得到充分探索。依赖 Text2Image 生成或 Img2Img 方法的 recent 技术往往难以生成准确代表类别的图像,同时又对数据集的多样性产生显著增加。为解决这些挑战,我们提出了 SaSPA:结构与主体保留性增强。与 recent 方法不同,我们的方法不使用真实图像作为指导,从而增加了生成的灵活性并促进了更大的多样性。为确保准确的类别表示,我们采用条件化机制,具体通过对图像边缘和主体表示进行条件化。我们进行了大量实验,并将 SaSPA 与传统和 recent 的生成式数据增强方法进行了基准测试。在包括完整数据集训练、情境偏差和 few-shot 分类等多个设置下,SaSPA 始终优于所有已建立的基线方法。此外,我们的结果揭示了使用合成数据用于 FGVC 模型的有趣模式;例如,我们发现真实数据使用量与合成数据最佳比例之间存在关系。代码已在 https://github.com/EyalMichaeli/SaSPA-Aug 提供。

关键词

引用

@article{arxiv.2406.14551,
  title  = {Advancing Fine-Grained Classification by Structure and Subject Preserving Augmentation},
  author = {Eyal Michaeli and Ohad Fried},
  journal= {arXiv preprint arXiv:2406.14551},
  year   = {2025}
}

备注

Accepted to NeurIPS 2024