对比学习视觉-语言模型的测试时分布归一化
机器学习
2023-10-20 v2 计算与语言
计算机视觉与模式识别
摘要
视觉-语言对比学习领域的进展使得许多下游应用能够通过简单地计算图像与文本表示的点积而高效、准确地执行。近期最具代表性的方法之一 CLIP 因其有效性获得了广泛采用。CLIP 使用 InfoNCE 损失进行训练,该损失同时考虑正负样本以帮助学习更鲁棒的特征表示空间。本文揭示常见的下游点积做法仅是优化目标的零阶近似,导致测试时信息丢失。直观上,由于模型基于 InfoNCE 损失优化,测试时流程也应与之对齐。问题在于如何以计算高效的方式在推理时检索任何类似负样本的信息。为此,我们提出分布归一化(DN),其中我们近似一批测试样本的均值表示,并用该均值表示 InfoNCE 损失中类似的负样本。DN 无需重训练或微调,可在推理时轻松应用。在多种下游任务上的大量实验表明,DN 相较于点积以及其他现有测试时增强方法具有明显优势。
引用
@article{arxiv.2302.11084,
title = {Test-Time Distribution Normalization for Contrastively Learned Vision-language Models},
author = {Yifei Zhou and Juntao Ren and Fengyu Li and Ramin Zabih and Ser-Nam Lim},
journal= {arXiv preprint arXiv:2302.11084},
year = {2023}
}
备注
Accepted to NeurIPS 2023, project webpage: https://fengyuli-dev.github.io/dn-website/