中文

DVLA-RL:基于强化学习门控的双层视觉语言对齐用于少样本学习

计算机视觉与模式识别 2026-02-25 v2

摘要

少样本学习(Few-shot Learning, FSL)旨在仅凭少量样本对新类别进行泛化。近期方法引入大型语言模型(LLM)通过类名派生的语义嵌入丰富视觉表征,但忽略了从低级到高级语义的渐进式和自适应对齐,导致语义提升有限。为此,我们提出一种双层视觉语言对齐结合强化学习门控方法(DVLA-RL),包括双层语义构建(Dual-level Semantic Construction, DSC)和强化学习门控注意力(RL-gated Attention, RLA)。具体而言,DSC 将 LLM 条件化于类名和支持样本,以生成判别性属性,逐步筛选最相关的属性,然后合成为连贯的类描述。此过程提供互补的低级属性和高级描述,实现细粒度 grounding 与整体类理解。为动态整合双层语义及视觉网络层次,RLA 将跨模态融合形式化为序列决策过程。一个轻量级策略通过 episodic REINFORCE 训练,自适应调整自注意力和交叉注意力的贡献,以整合文本和视觉标记。结果,浅层网络细化局部属性,深层网络强调全局语义,实现更精确的跨模态对齐,从而在仅少量支持样本的情况下实现类别特异性判别和通用表征。DVLA-RL 在三个多样化 FSL 场景中的九个基准上实现了新的状态-of-the-art 性能。

关键词

引用

@article{arxiv.2602.00795,
  title  = {DVLA-RL: Dual-Level Vision-Language Alignment with Reinforcement Learning Gating for Few-Shot Learning},
  author = {Wenhao Li and Xianjing Meng and Qiangchang Wang and Zhongyi Han and Zhibin Wu and Yilong Yin},
  journal= {arXiv preprint arXiv:2602.00795},
  year   = {2026}
}

备注

Accepted by ICLR 2026