中文

Fraesormer: 学习自适应稀疏 Transformer 以高效食物识别

计算机视觉与模式识别 2025-03-18 v1 人工智能

摘要

近年来, Transformer 在食物识别方面取得了显著进展。然而, 大多数现有方法仍面临两个关键挑战: (1) 由于与无关 token 之间的相互作用, 产生二次复杂度和冗余特征表示; (2) 静态特征识别和单尺度表征, 忽略了食物图像的非结构化、非固定性以及对多尺度特征的需求。为此, 我们提出一种自适应且高效的稀疏 Transformer 架构 (Fraesormer), 包含两个核心设计: 自适应 Top-k 稀疏部分注意力 (ATK-SPA) 和 分层尺度敏感特征门控网络 (HSSFGN)。ATK-SPA 使用可学习的 Gated Dynamic Top-K Operator (GDTKO) 保留关键注意力得分, 过滤阻碍特征聚合的低查询-键匹配。它还引入了部分通道机制以减少冗余并促进专家信息流动, 以实现局部-全局协作建模。HSSFGN 采用门控机制实现多尺度特征表征, 以增强上下文语义信息。大量实验表明, Fraesormer 超越了最先进的方法。代码可在 https://zs1314.github.io/Fraesormer 查看。

关键词

引用

@article{arxiv.2503.11995,
  title  = {Fraesormer: Learning Adaptive Sparse Transformer for Efficient Food Recognition},
  author = {Shun Zou and Yi Zou and Mingya Zhang and Shipeng Luo and Zhihao Chen and Guangwei Gao},
  journal= {arXiv preprint arXiv:2503.11995},
  year   = {2025}
}

备注

6 pages, 4 figures