中文

Swin-TUNA:一种用于精确食品图像分割的新型参数高效微调方法

计算机视觉与模式识别 2025-07-29 v3 人工智能

摘要

在食品图像处理领域,高效的语义分割技术对于工业应用至关重要。然而,现有基于Transformer的大规模模型(如FoodSAM)因其庞大的参数量和高计算资源需求,在满足实际部署要求方面面临挑战。本文介绍了可调适配器模块(Swin-TUNA),这是一种参数高效微调(PEFT)方法,它将多尺度可训练适配器集成到Swin Transformer架构中,仅通过更新4%的参数即可实现高性能的食品图像分割。Swin-TUNA的核心创新在于其分层特征自适应机制:它设计了深度方向上的可分离卷积和不同尺度的维度映射,以解决浅层和深层网络之间的特征差异,并结合了任务无关与任务特定特征的动态平衡策略。实验表明,该方法在FoodSeg103和UECFoodPix Complete数据集上分别达到了50.56%和74.94%的mIoU,超越了全参数化的FoodSAM模型,同时将参数量减少了98.7%(仅8.13M)。此外,Swin-TUNA在低数据场景下展现出更快的收敛速度和更强的泛化能力,为组装轻量级食品图像处理提供了高效解决方案。

关键词

引用

@article{arxiv.2507.17347,
  title  = {Swin-TUNA : A Novel PEFT Approach for Accurate Food Image Segmentation},
  author = {Haotian Chen and Zhiyong Xiao},
  journal= {arXiv preprint arXiv:2507.17347},
  year   = {2025}
}

备注

After discussion among the authors, some parts of the paper are deemed inappropriate and will be revised and resubmitted