中文

面向长尾分布的 LLM 赋能视觉语言模型微调中的动态提示路由

计算机视觉与模式识别 2025-08-22 v1

摘要

预训练视觉语言模型(VLM),如 CLIP,已在视觉任务中展现出强大的能力,但在面对类别不平衡的场景时进行微调常常受到偏见的影响。近期研究引入大型语言模型(LLM)来补充语义信息,以增强 VLM 的微调效果。然而,这些方法往往忽视了 VLM 预训练过程中固有的类别不平衡问题,可能导致下游任务中偏见的累积。为此,本文提出一种多维动态提示路由(MDPR)框架。MDPR 在五个视觉-语义维度上构建了类的全面知识库。在微调过程中,动态路由机制对齐全局视觉类别、检索最优提示,并平衡细粒度语义,从而通过 logits 融合实现稳定的预测。在包括 CIFAR-LT、ImageNet-LT 和 Places-LT 在内的长尾基准测试上进行大量实验,表明 MDPR 的性能与当前 SOTA 方法相当。消融研究进一步确认了针对尾部类别的语义库有效性,并表明动态路由的计算开销最小,使得 MDPR 成为在数据不平衡情况下进行 VLM 微调的灵活且高效的改进方案。

关键词

引用

@article{arxiv.2508.15688,
  title  = {LLM-empowered Dynamic Prompt Routing for Vision-Language Models Tuning under Long-Tailed Distributions},
  author = {Yongju Jia and Jiarui Ma and Xiangxian Li and Baiqiao Zhang and Xianhui Cao and Juan Liu and Yulong Bian},
  journal= {arXiv preprint arXiv:2508.15688},
  year   = {2025}
}

备注

accepted by EMNLP 2025