面向细粒度识别的移动网络中渐进式多阶段交互训练
计算机视觉与模式识别
2021-12-09 v1 机器学习
摘要
细粒度视觉分类(FGVC)旨在从子类别中识别物体。由于类间差异细微,这是一项极具挑战性的任务。现有研究应用大规模卷积神经网络或视觉Transformer作为特征提取器,计算成本极其高昂。事实上,细粒度识别的现实场景通常需要一种更轻量、可离线使用的移动网络。然而,移动网络的基础特征提取能力弱于大规模模型。本文基于轻量级MobilenetV2,提出了一种带有递归镶嵌生成器的渐进式多阶段交互训练方法(RMG-PMSI)。首先,我们提出一个递归镶嵌生成器(RMG),在不同阶段生成具有不同粒度的图像。然后,不同阶段的特征通过一个多阶段交互(MSI)模块,该模块增强并补充不同阶段的相应特征。最后,利用渐进式训练(P),模型在不同阶段提取的特征可以得到充分利用并相互融合。在三个著名的细粒度基准上的实验表明,RMG-PMSI能够显著提升性能,并具有良好的鲁棒性和可迁移性。
引用
@article{arxiv.2112.04223,
title = {Progressive Multi-stage Interactive Training in Mobile Network for Fine-grained Recognition},
author = {Zhenxin Wu and Qingliang Chen and Yifeng Liu and Yinqi Zhang and Chengkai Zhu and Yang Yu},
journal= {arXiv preprint arXiv:2112.04223},
year = {2021}
}