中文

基于二阶统计量的词根锚定提示学习:面向视觉语言模型

计算机视觉与模式识别 2026-04-07 v1 人工智能

摘要

参数高效提示学习已成为针对视觉语言模型(VLM)适配下游任务的事实标准。现有方法主要聚焦于将文本提示与一阶视觉特征(即空间特征图)对齐。虽然对细粒度语义判别有效,但我们认为仅依赖一阶信息对鲁健适配不够,因为这些空间交织特征对域迁移和局部噪声高度敏感。本文提出一种通过二阶统计量实现的词根锚定提示学习(Gram-Anchored Prompt Learning, GAPL),该框架融合局部语义对齐与全局结构一致性。方法上,我们通过词根矩阵引入额外的二阶统计流,以增强标准的一阶空间相互作用。通过将提示锚定在这些二阶先验上,本方法使语言表示能够动态适应不同领域中的统计分布变化。广泛的实验表明,二阶特征的有效性以及 GAPL 在各类基准上的卓越性能。

关键词

引用

@article{arxiv.2604.03980,
  title  = {Gram-Anchored Prompt Learning for Vision-Language Models via Second-Order Statistics},
  author = {Minglei Chen and Weilong Wang and Jiang Duan and Ye Deng},
  journal= {arXiv preprint arXiv:2604.03980},
  year   = {2026}
}