中文

反射引导:通过自引导图像自适应概念生成提升视觉语言模型的 OoDD 能力

计算机视觉与模式识别 2025-02-11 v2 人工智能

摘要

尽管基于大规模互联网数据训练的基础模型展现出卓越的泛化能力,但这些基础模型的可信度仍未得到充分探讨。特别是,大型视觉语言模型(LVLMs)如 GPT-4o,这些模型在大规模多模态数据上进行训练,其准确检测(OoDD)能力尚未得到充分关注。它们展示出的潜力与实际可靠性之间的差距引发了关于如何安全可靠地部署基础模型的担忧。为填补这一差距,我们评估和分析了各种专有和开源 LVLMs 的 OoDD 能力。我们的调查有助于更好地理解这些基础模型如何通过其生成的自然语言响应表示置信度得分。此外,我们提出了一种自引导提示方法,称为反射引导(ReGuide),旨在通过利用自生成的图像自适应概念建议来增强 LVLMs 的 OoDD 能力。实验结果表明,我们的 ReGuide 在当前 LVLMs 的图像分类和 OoDD 任务中均显著提升了性能。所采样的图像列表,以及每个样本的提示和响应,可在 https://github.com/daintlab/ReGuide 查看。

关键词

引用

@article{arxiv.2410.14975,
  title  = {Reflexive Guidance: Improving OoDD in Vision-Language Models via Self-Guided Image-Adaptive Concept Generation},
  author = {Jihyo Kim and Seulbi Lee and Sangheum Hwang},
  journal= {arXiv preprint arXiv:2410.14975},
  year   = {2025}
}

备注

Accepted at ICLR 2025. The first two authors contributed equally