PERL:CLIP 潜在空间中的参数高效推理
计算机视觉与模式识别
2026-05-20 v2
摘要
诸如 CLIP 等对比训练的视觉-语言模型通过在共享嵌入空间中对齐图像和文本,提供了强大的零样本迁移能力。然而,在不降低这些模型开放词汇泛化能力的情况下将其适配至下游任务仍具挑战。现有的参数高效适配方法通常通过学习提示、适配器或多模态变换来提升任务专用性,其中适配能力主要通过额外的可训练参数来体现。受语言模型中近期潜在推理方法的启发,我们研究了一个互补的视角:适配能否源于对潜在表示的迭代推理,而非仅仅增加参数量?我们提出了 PERL(Parameter-Efficient Reasoning in CLIP Latent Space,CLIP 潜在空间中的参数高效推理),这是一个轻量级适配框架,它通过在各个细化步骤中循环应用一个紧凑的共享推理模块来增强冻结的 CLIP 模型。在每一步中,PERL 根据当前表示生成一个潜在推理令牌,并将其注入中间编码器层,在保留 CLIP 预训练多模态结构的同时,逐步细化更高层级的语义表示。在涵盖基类到新类泛化、跨数据集迁移和分布外 ImageNet 变体的 15 个基准测试中,PERL 在快速适配少样本设置下的对比方法中实现了最佳的参数-性能权衡,结合了强大的新类准确率和有竞争力的迁移性能,而可训练参数仅约 6K,比最大的对比方法少 817 倍。总体而言,我们的结果表明,迭代潜在推理为判别式视觉-语言模型中的参数缩放提供了一种互补的适配机制。
引用
@article{arxiv.2605.18464,
title = {PERL: Parameter Efficient Reasoning in CLIP Latent Space},
author = {Simone Carnemolla and Salvatore Calcagno and Daniela Giordano and Concetto Spampinato and Matteo Pennisi},
journal= {arXiv preprint arXiv:2605.18464},
year = {2026}
}
备注
Submitted to NeurIPS 2026