中文

视觉也是你所需:利用多模态大语言模型导航离分布检测

计算机视觉与模式识别 2026-01-21 v1

摘要

离分布检测(OOD)是一个引起广泛关注的关键任务。CLIP的出现催生了大量关于零样本OOD检测的研究,常采用训练自由的方法。当前方法往往过度依赖大语言模型(LLMs)在文本空间中的专业知识,忽略了在图像空间检测离分布样本所面临的固有挑战。本文提出了一种新型管道,MM-OOD,利用多模态大语言模型(MLLMs)的多模态推理能力及其进行多轮对话的能力以增强异常检测。我们的方法旨在提高近OOD和远OOD任务的性能。具体地,(1)对于近OOD任务,我们直接将ID图像和相应的文本提示输入MLLMs以识别潜在异常值;(2)对于远OOD任务,我们引入sketch-generate-elaborate框架:首先使用文本提示绘制异常暴露,然后生成相应的视觉异常样本,最后通过多模态提示进行详尽推理。实验表明,我们的方法在广泛使用的多模态数据集如Food-101上实现了显著改进,同时也验证了其在ImageNet-1K上的可扩展性。

关键词

引用

@article{arxiv.2601.14052,
  title  = {Vision Also You Need: Navigating Out-of-Distribution Detection with Multimodal Large Language Model},
  author = {Haoran Xu and Yanlin Liu and Zizhao Tong and Jiaze Li and Kexue Fu and Yuyang Zhang and Longxiang Gao and Shuaiguang Li and Xingyu Li and Yanran Xu and Changwei Wang},
  journal= {arXiv preprint arXiv:2601.14052},
  year   = {2026}
}