基于高效端到端定位的细粒度视觉分类
计算机视觉与模式识别
2020-05-12 v1
摘要
细粒度视觉分类(FGVC)一词指的是类别间非常相似、分类模型需能发现细微差异以做出正确预测的分类任务。最先进的方法通常包含一个定位步骤,旨在通过定位输入图像的相关部分来辅助分类网络。然而,这通常需要多次迭代或通过完整分类网络的多遍前向传播,或复杂的训练调度。本工作中我们提出一种高效的定位模块,可在端到端设置中与分类网络融合。一方面,该模块由从分类网络反向传播的梯度训练;另一方面,引入两个自监督损失函数以提升定位精度。我们在三个基准数据集 CUB200-2011、Stanford Cars 和 FGVC-Aircraft 上评估了新模型,并取得了具有竞争力的识别性能。
引用
@article{arxiv.2005.05123,
title = {Fine-Grained Visual Classification with Efficient End-to-end Localization},
author = {Harald Hanselmann and Hermann Ney},
journal= {arXiv preprint arXiv:2005.05123},
year = {2020}
}