中文

Generalized SAM: 可变输入图像大小的 SAM 高效微调方法

计算机视觉与模式识别 2026-04-06 v2

摘要

近期有大量研究旨在提高基础模型微调的效率。本文提出了一种新颖的高效微调方法,使 Segment Anything Model (SAM) 的输入图像尺寸可变。SAM 是在大型数据集上训练的用于图像分割的强大基础模型,但需要进行微调以识别任意类别。SAM 的输入图像尺寸固定为 1024 x 1024,在训练期间导致巨大的计算需求。此外,固定的输入图像尺寸可能导致图像信息丢失,例如由于固定的宽高比。为解决此问题,我们提出了 Generalized SAM (GSAM)。与先前方法不同,GSAM 是首次在训练时对 SAM 应用随机裁剪,从而显著降低了训练计算成本。各种类型和像素数量的数据集上的实验表明,GSAM 可以比 SAM 和其他 SAM 微调方法更高效地训练,实现与之相当或更高的准确率。

关键词

引用

@article{arxiv.2408.12406,
  title  = {Generalized SAM: Efficient Fine-Tuning of SAM for Variable Input Image Sizes},
  author = {Sota Kato and Hinako Mitsuoka and Kazuhiro Hotta},
  journal= {arXiv preprint arXiv:2408.12406},
  year   = {2026}
}

备注

Accepted by ECCV2024 Workshop "Computational Aspects of Deep Learning (CADL)"