通过多模态表示的跨模态对齐增强分布外检测
计算机视觉与模式识别
2025-03-25 v1 人工智能
摘要
此前的分布外检测 (OoDD) 研究主要集中于单模态模型. 近年来,随着 CLIP 等大规模预训练视觉-语言模型的出现,基于此类多模态表示并采用零样本和提示学习策略的 OoDD 方法应运而生. 然而,这些方法通常冻结预训练权重或仅对其进行部分微调,这对于下游数据集而言可能是次优的. 本文重点指出,多模态微调 (MMFT) 能够取得显著的 OoDD 性能. 尽管已有一些近期工作展示了微调方法对 OoDD 的影响,但仍存在显著的性能提升空间. 我们研究了朴素微调方法的局限性,分析了它们为何未能充分利用预训练知识. 我们的实证分析表明,这一问题可能源于分布内 (ID) 嵌入中的模态鸿沟. 为此,我们提出了一种训练目标,通过正则化 ID 数据图像与文本嵌入之间的距离来增强跨模态对齐. 这一调整有助于在超球面表示空间中将来自不同模态(即文本和图像)的相似语义对齐得更紧密,从而更好地利用预训练的文本信息. 我们从理论上证明,所提出的正则化对应于超球面上基于能量的模型的最大似然估计. 利用 ImageNet-1k OoD 基准数据集,我们表明,我们的方法与利用预训练知识的后处理 OoDD 方法(如 NegLabel)相结合,显著优于现有方法,取得了 SOTA 的 OoDD 性能与领先的 ID 准确率.
引用
@article{arxiv.2503.18817,
title = {Enhanced OoD Detection through Cross-Modal Alignment of Multi-Modal Representations},
author = {Jeonghyeon Kim and Sangheum Hwang},
journal= {arXiv preprint arXiv:2503.18817},
year = {2025}
}
备注
CVPR 2025