中文

超越图模型:通过随机图适配器实现可靠的视觉-语言模型微调

计算机视觉与模式识别 2025-07-15 v1

摘要

基于文本适配器的微调方法在将预训练视觉-语言模型(VLMs)的知识迁移至下游任务方面展现出巨大潜力。现有工作通常采用确定性的文本特征适配器来精炼每个类别的文本表示。然而,由于属性和上下文等内在因素,每个类别的文本描述存在显著的多样性。这种描述多样性蕴含丰富的判别性语义知识,能够助力下游视觉学习任务。显然,传统的确定性适配器模型无法充分捕捉这种多变的语义信息。同时,利用 VLM 适配器中的类间关系也是值得期待的。为了解决这些问题,我们提出将随机图模型引入 VLM 适配器,并开发了一种新颖的顶点随机图适配器(VRGAdapter)。VRGAdapter 首先通过利用顶点随机知识图(VRKG)模型,同时建模每个类别的内在多样描述以及不同类别之间的类间关系;然后,在 VRKG 上执行概率消息传播,以学习每个类节点的上下文感知分布表示;最后,采用重参数化采样函数实现文本适配器学习。值得注意的是,VRGAdapter 提供了一种更具普适性的适配器解决方案,将传统的基于图的适配器作为其特例。此外,为了使下游任务获得更稳健的性能,我们还引入了一种新的不确定性引导多分支融合(UMF)方案,动态集成多个预训练模型进行集成预测。在多个基准数据集上的大量实验证明了我们方法的有效性。

关键词

引用

@article{arxiv.2507.10355,
  title  = {Beyond Graph Model: Reliable VLM Fine-Tuning via Random Graph Adapter},
  author = {Bo Jiang and Xueyang Ze and Beibei Wang and Xixi Wang and Xixi Wan and Bin Luo},
  journal= {arXiv preprint arXiv:2507.10355},
  year   = {2025}
}