中文

结合窗口注意力与空间注意力的轻量级视觉 Transformer 用于食物图像分类

计算机视觉与模式识别 2025-09-24 v1

摘要

随着社会的快速发展和科学技术的不断进步,食品工业对生产质量和效率的要求日益提高。食物图像分类在实现生产线自动化质量控制、支持食品安全监管以及促进智能农业生产方面发挥着至关重要的作用。然而,由于视觉 Transformer 模型参数量大且计算复杂度高,该任务面临诸多挑战。为解决这些问题,我们提出了一种轻量级食物图像分类算法,该算法集成了窗口多头注意力机制(WMHAM)和空间注意力机制(SAM)。WMHAM 通过高效的窗口划分捕获局部和全局上下文特征以降低计算成本,而 SAM 则自适应地突出关键空间区域以改善判别性特征表征。在 Food-101 和 Vireo Food-172 数据集上进行的实验表明,与基线方法相比,我们的模型分别实现了 95.24% 和 94.33% 的准确率,同时显著减少了参数量和浮点运算数。这些结果证实,所提出的方法在计算效率和分类性能之间取得了有效平衡,非常适合部署在资源受限的环境中。

关键词

引用

@article{arxiv.2509.18692,
  title  = {Lightweight Vision Transformer with Window and Spatial Attention for Food Image Classification},
  author = {Xinle Gao and Linghui Ye and Zhiyong Xiao},
  journal= {arXiv preprint arXiv:2509.18692},
  year   = {2025}
}