中文

更佳视觉语言推理的特征投影学习

计算机视觉与模式识别 2026-01-29 v1

摘要

利用对比学习的视觉语言预训练模型(尤其是 CLIP)在提取可泛化视觉特征方面表现突出。为了继承 VLP 模型在下游任务上的已学习知识,several 方法旨在高效适应有限监督。然而,这些方法要么性能有限,要么可学习参数过多,要么训练时间过长,都阻碍了 CLIP 模型适应下游任务的有效性。本文提出一种简单且高效有效的方法,称为特征投影学习(FPL),以解决上述问题。具体而言,我们开发了一个投影模型,将类原型特征投影到查询图像特征空间中并重构查询图像特征图。将负平均平方重构误差用作类得分。如此一来,我们将分类问题转化为特征投影问题。本方法的最终输出是来自投影模型预测与原始预训练 CLIP 的组合。全面实证评估表明,FPL 在准确率上优于当前最先进的方法,优势显著。

关键词

引用

@article{arxiv.2601.20224,
  title  = {Feature Projection Learning for Better Vision-Language Reasoning},
  author = {Yi Zhang and Weicheng Lin and Liang-Jie Zhang},
  journal= {arXiv preprint arXiv:2601.20224},
  year   = {2026}
}

备注

Accepted to ICASSP 2026