中文

SimMAT:探索从视觉基础模型到任意图像模态的可迁移性

计算机视觉与模式识别 2024-09-13 v1

摘要

像 ChatGPT 和 Sora 这样在海量数据上训练的基础模型已经产生了革命性的社会影响。然而,对于许多不同领域的传感器来说,收集类似规模的自然图像来训练强大的基础模型是极具挑战性的。为此,本研究提出了一个简单而有效的框架 SimMAT,以研究一个开放性问题:从在自然 RGB 图像上训练的视觉基础模型向具有不同物理性质(例如偏振)的其他图像模态的可迁移性。SimMAT 由一个与模态无关的迁移层(MAT)和一个预训练的基础模型组成。我们将 SimMAT 应用于具有代表性的视觉基础模型 Segment Anything Model(SAM),以支持任何被评估的新图像模态。鉴于缺乏相关基准,我们构建了一个新的基准来评估迁移学习性能。我们的实验证实了迁移视觉基础模型在增强其他传感器性能方面具有巨大潜力。具体而言,SimMAT 能够将所评估模态的分割性能(mIoU)平均从 22.15% 提升至 53.88%,并始终优于其他基线方法。我们希望 SimMAT 能够引起人们对跨模态迁移学习的关注,并使各个领域受益,利用视觉基础模型获得更好的结果。

关键词

引用

@article{arxiv.2409.08083,
  title  = {SimMAT: Exploring Transferability from Vision Foundation Models to Any Image Modality},
  author = {Chenyang Lei and Liyi Chen and Jun Cen and Xiao Chen and Zhen Lei and Felix Heide and Ziwei Liu and Qifeng Chen and Zhaoxiang Zhang},
  journal= {arXiv preprint arXiv:2409.08083},
  year   = {2024}
}

备注

Github link: https://github.com/mt-cly/SimMAT