中文

结合 Vision Transformers 与 Segment Anything Model 的弱监督食物图像分割

计算机视觉与模式识别 2025-10-23 v2

摘要

本文提出了一种针对食物图像的弱监督语义分割方法,该方法利用了 Segment Anything Model (SAM) 的零样本能力和可提示性,以及 Vision Transformers (ViTs) 的注意力机制。具体而言,我们使用来自 ViTs 的类激活图作为 SAM 的提示,生成适用于食物图像分割的掩码。该 ViT 模型(Swin Transformer)仅使用图像级标注进行训练,消除了训练过程中对像素级标注的需求。此外,为了提高 SAM 生成掩码的质量,我们探讨了图像预处理技术结合单掩码和多掩码 SAM 生成策略的使用。该方法在 FoodSeg103 数据集上进行了评估,每张图像平均生成 2.4 个掩码(不包括背景),在多掩码场景下实现了 0.54 的 mIoU。我们设想所提出的方法可作为加速食物图像标注任务的工具,或作为食物与营养追踪应用中的集成组件。

关键词

引用

@article{arxiv.2509.19028,
  title  = {Weakly Supervised Food Image Segmentation using Vision Transformers and Segment Anything Model},
  author = {Ioannis Sarafis and Alexandros Papadopoulos and Anastasios Delopoulos},
  journal= {arXiv preprint arXiv:2509.19028},
  year   = {2025}
}

备注

Accepted for presentation at the 20th International Workshop on Semantic and Social Media Adaptation & Personalization (SMAP 2025)