微调如何影响视觉-语言模型的分布外检测?
计算机视觉与模式识别
2024-07-30 v3 计算机与社会
机器学习
摘要
近期诸如 CLIP 的大型视觉-语言模型已展现出卓越的分布外(OOD)检测与泛化性能。然而,其对下游数据集的零样本分布内(ID)准确率往往有限。近期基于 CLIP 的微调方法(如提示学习)在 ID 分类与有 OOD 标签时的 OOD 泛化方面已展现出显著改进。尽管如此,在没有 OOD 标签的情况下,模型对语义偏移是否可靠仍不清楚。在本文中,我们旨在弥合这一差距,并给出一项理解微调如何影响少样本下游任务中 OOD 检测的综合研究。通过将 OOD 检测构建为多模态概念匹配,我们建立了微调方法与各类 OOD 分数之间的联系。我们的结果表明,恰当选择 OOD 分数对于基于 CLIP 的微调至关重要。特别地,最大概念匹配(MCM)分数始终提供了一种有前景的解决方案。我们还表明,提示学习相比零样本对应方法展现出最先进的 OOD 检测性能。
引用
@article{arxiv.2306.06048,
title = {How Does Fine-Tuning Impact Out-of-Distribution Detection for Vision-Language Models?},
author = {Yifei Ming and Yixuan Li},
journal= {arXiv preprint arXiv:2306.06048},
year = {2024}
}
备注
Accepted to IJCV 2023