通过噪声增强视觉语言对齐
计算机视觉与模式识别
2024-12-18 v2 人工智能
摘要
随着预训练视觉语言(VL)模型的发展,增强下游任务中视觉与语言模态之间的对齐已成为关键挑战。不同于添加额外模块来调整这两种模态的现有微调方法,我们研究是否可以通过定制化噪声来微调冻结的模型。我们的方法灵感来自对有益噪声的科学研究,即正向激励噪声(Pi-noise 或 -noise),它定量分析了噪声的影响。因此,这暗示了一种新的学习有益噪声分布的方案,可用于微调 VL 模型。针对基于 CLIP 的少样本分类任务,我们重新定义了 CLIP 的推理过程并应用变分推断,展示了如何生成针对视觉和语言模态的 -noise。随后,我们提出了正向激励噪声注入器(PiNI),该注入器可通过向视觉和文本编码器注入噪声来微调 CLIP。由于该方法可以学习有益噪声的分布,我们可以获得更丰富的视觉和语言嵌入,以在有限的计算资源内更好地对齐这两个模态以适应特定的下游任务。我们评估了不同的噪声整合方法和 PiNI 的网络架构。在 11 个数据集上的评估表明其有效性。
引用
@article{arxiv.2412.10817,
title = {Enhance Vision-Language Alignment with Noise},
author = {Sida Huang and Hongyuan Zhang and Xuelong Li},
journal= {arXiv preprint arXiv:2412.10817},
year = {2024}
}
备注
Accepted by AAAI 2025