CALIP:基于无参数注意力增强 CLIP 的零样本能力
计算机视觉与模式识别
2022-12-20 v2 人工智能
多媒体
摘要
对比语言-图像预训练(CLIP)已被证明能够学习具有强迁移性的视觉表征,并在零样本分类中取得令人满意的准确率。为进一步提升其下游性能,现有工作在 CLIP 上引入额外的可学习模块,并使用少样本训练集进行微调。然而,由此带来的额外训练成本和数据需求严重阻碍了模型部署与知识迁移的效率。本文提出一种免午餐的增强方法 CALIP,通过无参数注意力模块提升 CLIP 的零样本性能。具体而言,我们引导视觉与文本表征相互交互,并借助注意力探索跨模态信息特征。由于预训练已大幅缩小两模态间的嵌入距离,我们舍弃注意力中所有可学习参数,并双向更新多模态特征,使整个过程无需参数且无需训练。如此,图像融合了文本感知信号,文本表征也变为视觉引导,从而实现更好的自适应零样本对齐。我们在涵盖 14 个数据集的多种基准上评估 CALIP 的 2D 图像与 3D 点云少样本分类,显示出相对于 CLIP 一致的零样本性能提升。在此基础上,我们进一步在 CALIP 的注意力模块中插入少量线性层,并在少样本设定下验证鲁棒性,同样取得优于现有方法的领先性能。这些大量实验证明了我们方法在高效增强 CLIP 方面的优越性。
引用
@article{arxiv.2209.14169,
title = {CALIP: Zero-Shot Enhancement of CLIP with Parameter-free Attention},
author = {Ziyu Guo and Renrui Zhang and Longtian Qiu and Xianzheng Ma and Xupeng Miao and Xuming He and Bin Cui},
journal= {arXiv preprint arXiv:2209.14169},
year = {2022}
}
备注
Accepted by AAAI 2023, 12 pages, 6 figures