Res-VMamba:利用具有深度残差学习的选择性状态空间模型进行细粒度食物类别视觉分类
计算机视觉与模式识别
2024-09-09 v3 人工智能
摘要
食物分类是开发食物视觉任务的基础,并在蓬勃发展的计算营养学领域发挥着关键作用。由于食物分类需要细粒度处理且较为复杂,近期的学术研究主要修改卷积神经网络(CNNs)和/或视觉 Transformer(ViTs)来执行食物类别分类。然而,为了学习细粒度特征,CNN 骨干网络需要额外的结构设计,而包含自注意力模块的 ViT 则增加了计算复杂度。近几个月来,一种新的序列状态空间(S4)模型,通过选择机制和扫描计算(S6),俗称 Mamba,展现出优于 Transformer 架构的性能和计算效率。将 Mamba 机制融入图像任务(如分类)的 VMamba 模型,目前在 ImageNet 数据集上确立了最先进(SOTA)的性能。在本研究中,我们引入了一个在学术界被低估的食物数据集 CNFOOD-241,并率先在 VMamba 模型中整合了残差学习框架,以同时利用原始 VMamba 架构设计中固有的全局和局部状态特征。研究结果表明,VMamba 在细粒度和食物分类方面超越了当前的 SOTA 模型。所提出的 Res-VMamba 在未使用预训练权重的情况下,进一步将分类准确率提升至 79.54%。我们的研究结果阐明,所提出的方法在 CNFOOD-241 数据集的食物识别上建立了新的 SOTA 性能基准。代码可在 GitHub 获取:https://github.com/ChiShengChen/ResVMamba。
引用
@article{arxiv.2402.15761,
title = {Res-VMamba: Fine-Grained Food Category Visual Classification Using Selective State Space Models with Deep Residual Learning},
author = {Chi-Sheng Chen and Guan-Ying Chen and Dong Zhou and Di Jiang and Dai-Shi Chen},
journal= {arXiv preprint arXiv:2402.15761},
year = {2024}
}
备注
14 pages, 3 figures