中文

SimCMF:一种从视觉基础模型到任意成像模态的简单跨模态微调策略

计算机视觉与模式识别 2024-12-02 v1

摘要

像ChatGPT和Sora这样的基础模型是在大规模数据上训练的,已对社会产生了革命性影响。然而,来自不同领域的传感器收集类似规模的自然图像来训练强大的基础模型极具挑战性。针对这一问题,本工作提出一种简单且有效的框架SimCMF,来研究一个重要问题:从在自然RGB图像上训练的视觉基础模型,跨模态微调到具有不同物理属性的其他成像模态(例如偏振)。在SimCMF中,我们对从最原始设计中不同基本组件进行了彻底分析,并最终提出一种新的跨模态对齐模块来解决模态错位问题。我们将SimCMF应用于代表性的视觉基础模型Segment Anything Model (SAM),以支持任何评估的新成像模态。鉴于缺乏相关基准, 我们构建了一个用于性能评估的基准。我们的实验确认了将视觉基础模型用于提升其他传感器性能的奇妙潜力。SimCMF在平均情况下将评估模态的分割性能(mIoU)从22.15%提升至53.88%,并始终优于其他基线方法。代码可在https://github.com/mt-cly/SimCMF获取。

关键词

引用

@article{arxiv.2411.18669,
  title  = {SimCMF: A Simple Cross-modal Fine-tuning Strategy from Vision Foundation Models to Any Imaging Modality},
  author = {Chenyang Lei and Liyi Chen and Jun Cen and Xiao Chen and Zhen Lei and Felix Heide and Qifeng Chen and Zhaoxiang Zhang},
  journal= {arXiv preprint arXiv:2411.18669},
  year   = {2024}
}

备注

project page: https://mt-cly.github.io/SimCMF.github.io/. arXiv admin note: substantial text overlap with arXiv:2409.08083