中文

基于图神经网络的多模态参数高效微调

计算机视觉与模式识别 2024-08-02 v1 人工智能

摘要

随着基础模型时代的到来,预训练与微调已成为常见范式。最近,参数高效微调因其可学习参数数量与性能之间的更好平衡而受到广泛关注。然而,一些现有的参数高效微调方法仅对单一模态建模,缺乏对下游任务中结构知识的利用。为解决这一问题,本文提出了一种基于图网络的多模态参数高效微调方法。每张图像被输入多模态大语言模型(MLLM)以生成文本描述。然后,图像及其对应的文本描述分别经过冻结的图像编码器和文本编码器处理,生成图像特征和文本特征。基于多模态特征节点的相似性构建图,并从每个节点中提取与这些特征相关的知识和关系。此外,弹性权重巩固(EWC)正则化被纳入损失函数,以缓解任务学习过程中的遗忘问题。所提出的模型在OxfordPets、Flowers102和Food101数据集上的测试准确率分别提高了4.45%、2.92%和0.23%。代码可在 https://github.com/yunche0/GA-Net/tree/master 获取。

关键词

引用

@article{arxiv.2408.00290,
  title  = {Multi-Modal Parameter-Efficient Fine-tuning via Graph Neural Network},
  author = {Bin Cheng and Jiaxuan Lu},
  journal= {arXiv preprint arXiv:2408.00290},
  year   = {2024}
}