UniRGB-IR: 通过适配器调优实现可见光-红外语义任务的统一框架
计算机视觉与模式识别
2025-10-14 v4
摘要
可见光(RGB)和红外(IR)图像的语义分析因其在低光照和恶劣天气等挑战性条件下增强的准确性和鲁棒性而受到广泛关注。然而,由于缺乏在大规模红外图像数据集上预训练的基础模型,现有方法倾向于设计特定任务的框架,并直接使用预训练的基础模型在其RGB-IR语义相关性数据集上进行微调,这导致可扩展性差且泛化能力有限。为解决这些限制,我们提出了UniRGB-IR,一个可扩展且高效的RGB-IR语义任务框架,它引入了一种新颖的适配器机制,以有效地将丰富的多模态特征融入预训练的基于RGB的基础模型中。我们的框架包含三个关键组件:一个视觉变换器(ViT)基础模型、一个多模态特征池(MFP)模块和一个补充特征注入器(SFI)模块。MFP和SFI模块相互协作,作为一个适配器,有效地用上下文多尺度特征补充ViT特征。在训练过程中,我们冻结整个基础模型以继承先验知识,仅优化MFP和SFI模块。此外,为了验证我们框架的有效性,我们使用ViT-Base作为预训练基础模型进行了大量实验。在各种RGB-IR语义任务上的实验结果表明,我们的方法可以达到最先进的性能。
引用
@article{arxiv.2404.17360,
title = {UniRGB-IR: A Unified Framework for Visible-Infrared Semantic Tasks via Adapter Tuning},
author = {Maoxun Yuan and Bo Cui and Tianyi Zhao and Jiayi Wang and Shan Fu and Xue Yang and Xingxing Wei},
journal= {arXiv preprint arXiv:2404.17360},
year = {2025}
}
备注
10 pages, 6 figures, Accepted by ACM MM 2025