中文

RSAdapter:适配多模态模型用于遥感视觉问答

计算机视觉与模式识别 2024-10-17 v2 机器学习

摘要

近年来,随着Transformer模型的快速发展,基于Transformer的多模态架构已在各种下游任务中得到广泛应用,包括但不限于图像描述、视觉问答(VQA)和图像-文本生成。然而,当前的遥感(RS)VQA方法常涉及资源密集型技术,例如对大型模型进行全量微调,或从预训练多模态模型中提取图像-文本特征,随后使用解码器进行模态融合。这些方法需要大量计算资源与时间,并引入可观数量的可训练参数。为应对这些挑战,我们提出一种称为RSAdapter的新方法,其优先考虑运行时间与参数效率。RSAdapter包含两个关键组件:并行适配器(Parallel Adapter)以及在适配器内每个全连接(FC)层之后插入的额外线性变换层。该方法不仅改善了对预训练多模态模型的适配,还允许在推理时将线性变换层的参数整合进前面的FC层,从而降低推理成本。为证明RSAdapter的有效性,我们使用三个不同的RS-VQA数据集进行了大量实验,并在所有三个数据集上取得了最先进(state-of-the-art)的结果。RSAdapter的代码可在 https://github.com/Y-D-Wang/RSAdapter 在线获取。

关键词

引用

@article{arxiv.2310.13120,
  title  = {RSAdapter: Adapting Multimodal Models for Remote Sensing Visual Question Answering},
  author = {Yuduo Wang and Pedram Ghamisi},
  journal= {arXiv preprint arXiv:2310.13120},
  year   = {2024}
}