中文

利用基于对话的大型视觉语言模型进行多模态脱离上下文检测

计算机视觉与模式识别 2024-03-15 v1 人工智能

摘要

脱离上下文(OOC)检测是一项具有挑战性的任务,涉及识别与其所处语境不相关的图像和文本。大型视觉语言模型(LVLM)在各种任务中表现出色,包括图像分类和文本生成。然而,它们在多模态 OOC 检测任务中的熟练程度尚不清楚。在本文中,我们研究了 LVLM 检测多模态 OOC 的能力,并表明如果不进行微调,这些模型无法在 OOC 检测任务上达到高准确率。然而,我们证明在多模态 OOC 数据集上微调 LVLM 可以进一步提高其 OOC 检测准确率。为了评估 LVLM 在 OOC 检测任务上的性能,我们在 NewsCLIPpings 数据集(一个大型多模态 OOC 数据集)上对 MiniGPT-4 进行了微调。我们的结果表明,在 NewsCLIPpings 数据集上微调 MiniGPT-4 显著提高了该数据集上的 OOC 检测准确率。这表明微调可以显著提高 LVLM 在 OOC 检测任务上的性能。

关键词

引用

@article{arxiv.2403.08776,
  title  = {Leveraging Chat-Based Large Vision Language Models for Multimodal Out-Of-Context Detection},
  author = {Fatma Shalabi and Hichem Felouat and Huy H. Nguyen and Isao Echizen},
  journal= {arXiv preprint arXiv:2403.08776},
  year   = {2024}
}

备注

13 pages, 6 figures , conference