CNN 与 ViT 组合特征在零售型识别中的应用
计算机视觉与模式识别
2024-10-08 v2
摘要
我们应用了预训练的架构,这些架构原本为 ImageNet 大规模视觉识别挑战赛而开发,用于眼周区域识别。这些架构在计算机视觉任务中取得了显著的成功,不仅限于其设计的任务。本工作建立在我们之前使用离线卷积神经网络 (CNN) 的研究基础上,并将其扩展到更近期提出的视觉转换器 (ViT)。尽管这些模型是为通用对象分类而训练的,CNN 和 ViT 的中间层特征仍然适合基于眼周图像识别个体。我们还展示了 CNN 和 ViT 高度互补,因为它们的组合导致准确率提升。此外,我们表明,这些预训练模型的部分小比例即可实现良好的准确率,从而产生更薄的模型,具有更少的参数,适用于资源受限的环境如移动设备。这种效率可以通过添加传统手工特征来进一步提高。
引用
@article{arxiv.2407.19472,
title = {Combined CNN and ViT features off-the-shelf: Another astounding baseline for recognition},
author = {Fernando Alonso-Fernandez and Kevin Hernandez-Diaz and Prayag Tiwari and Josef Bigun},
journal= {arXiv preprint arXiv:2407.19472},
year = {2024}
}
备注
Accepted at IEEE WIFS 2024