中文

监督分类头作为语义原型:通过权重循环解锁视觉语言对齐

计算机视觉与模式识别 2026-05-22 v1

摘要

视觉语言模型(VLMs)在零样本分类和跨模态检索等任务中表现出色,通过将图像和文本映射到共享空间,但这需要大量配对数据进行端到端训练。当前的事后对齐方法通过轻量级映射将预训练编码器连接起来,降低了计算成本,但仍需大量配对数据。本文我们研究将预训练视觉模型的分类头重新用作语义原型的潜力。这些权重(通常在预训练后被丢弃)的循环使用 unlocks 两种 distinct 能力:通过将权重用作语义锚点实现零样本对齐,并通过混合这些原型与真实图像-文本对作为强大的数据增强策略。我们展示了将本方法集成到几种最先进的事后对齐技术中,能在跨模态检索、零样本和少样本分类任务中一致性提升准确率。

关键词

引用

@article{arxiv.2605.22484,
  title  = {Supervised Classification Heads as Semantic Prototypes: Unlocking Vision-Language Alignment via Weight Recycling},
  author = {David Méndez and Roberto Confalonieri and Natalia Díaz Rodríguez},
  journal= {arXiv preprint arXiv:2605.22484},
  year   = {2026}
}