GraphAdapter:利用双知识图微调视觉-语言模型
计算机视觉与模式识别
2023-09-26 v1 人工智能
摘要
适配器式高效迁移学习(ETL)在低数据条件下微调视觉-语言模型(VLMs)时表现出优异性能,其仅引入少量额外参数,基于 VLMs 通用且强大的表征来挖掘任务特定知识。然而,大多数适配器式工作面临两点局限:(i) 仅以单一模态建模任务特定知识;(ii) 忽视下游任务中类间关系的利用,从而导致次优解。为缓解该问题,我们提出一种有效的适配器式微调策略,称为 GraphAdapter,其通过双知识图显式建模双模态结构知识(即文本与视觉模态中不同语义/类别的关联)来实现文本适配器。具体而言,双知识图由文本知识子图和视觉知识子图两个子图构建,其中节点与边分别表示两模态中的语义/类别及其关联。这使得每个提示的文本特征能够利用来自文本与视觉双模态的任务特定结构知识,从而为下游任务生成更有效的分类器。在 11 个基准数据集上的大量实验结果表明,我们的 GraphAdapter 显著优于以往的基于适配器的方法。代码将发布于 https://github.com/lixinustc/GraphAdapter
引用
@article{arxiv.2309.13625,
title = {GraphAdapter: Tuning Vision-Language Models With Dual Knowledge Graph},
author = {Xin Li and Dongze Lian and Zhihe Lu and Jiawang Bai and Zhibo Chen and Xinchao Wang},
journal= {arXiv preprint arXiv:2309.13625},
year = {2023}
}
备注
Accepted by NeurIPS 2023. The manuscript will be further revised based on the reviews