中文

Spotlighter:从代表性挖掘视角重审提示微调

计算机视觉与模式识别 2025-09-04 v2 人工智能

摘要

CLIP的成功表明,提示微调可以为从开放域识别到细粒度分类的任务实现鲁棒的跨模态语义对齐。然而,冗余或弱相关的特征成分会引入噪声并产生不必要的计算成本。在这项工作中,我们提出了Spotlighter,一个轻量级的令牌选择框架,可同时提升提示微调的准确性和效率。Spotlighter从样本层面和语义层面评估每个视觉令牌的激活程度,并仅保留得分最高的令牌用于下游预测。一个由学习到的原型构成的类别特定语义记忆库优化了这一选择过程,确保了语义代表性并补偿了被丢弃的特征。为了进一步优先处理信息性信号,我们引入了一种两级排序机制,动态加权令牌与原型之间的交互。在11个小样本基准测试中,Spotlighter在调和平均准确率上比CLIP高出多达11.19%,并实现了高达0.8K的额外FPS,且仅增加了21个额外参数。这些结果确立了Spotlighter作为提示调优中一个有效且可扩展的基线。我们方法的代码将发布于https://github.com/greatest-gourmet/Spotlighter。

关键词

引用

@article{arxiv.2509.00905,
  title  = {Spotlighter: Revisiting Prompt Tuning from a Representative Mining View},
  author = {Yutong Gao and Maoyuan Shao and Xinyang Huang and Chuang Zhu and Lijuan Sun and Yu Weng and Xuan Liu and Guoshun Nan},
  journal= {arXiv preprint arXiv:2509.00905},
  year   = {2025}
}

备注

Accepted as EMNLP 2025 Findings