中文

利用姿态信息使VLM识别卡通人物图像上的视觉幻觉

计算机视觉与模式识别 2026-03-09 v4 人工智能 机器学习 多媒体

摘要

利用大规模文本到图像(TTI)模型已成为图像合成、视频编辑、3D重建等领域生成样本或训练数据集的常用技术。然而,涉及感知严重缺陷的语义结构视觉幻觉仍然令人担忧,尤其是在非真实感渲染(NPR)领域,如卡通和像素化风格角色。为检测NPR中的这些幻觉,我们提出了一种使用视觉语言模型(VLM)的新型语义结构幻觉检测系统。我们的方法是利用大型语言模型的新兴能力——上下文学习,即VLM已通过用户为特定下游任务(此处为幻觉检测)看到了一些示例。基于上下文学习,我们引入了姿态感知上下文视觉学习(PA-ICVL),通过进一步输入除提示、RGB图像和姿态信息之外的视觉数据,提升了VLM的整体性能。通过融入姿态引导,我们使VLM能够做出更准确的决策。实验结果表明,与仅依赖RGB图像的基线方法相比,在识别视觉幻觉方面有显著改进。在选定的两个VLM——GPT-4v和Gemini Pro Vision中,我们提出的PA-ICVL将幻觉检测性能分别从50%提升至78%,从57%提升至80%。这项研究通过上下文视觉学习减轻视觉幻觉,推进了TTI模型面向真实世界应用的能力,扩展了其在非真实感领域的潜力。此外,它展示了用户如何通过利用附加条件来提升开放VLM的下游专用能力。我们使用TTI模型收集了合成卡通幻觉数据集,该数据集和最终微调的VLM将公开可用。

关键词

引用

@article{arxiv.2403.15048,
  title  = {Make VLM Recognize Visual Hallucination on Cartoon Character Image with Pose Information},
  author = {Bumsoo Kim and Wonseop Shin and Kyuchul Lee and Yonghoon Jung and Sanghyun Seo},
  journal= {arXiv preprint arXiv:2403.15048},
  year   = {2026}
}

备注

Accepted at WACV 2025, Project page: https://gh-bumsookim.github.io/Cartoon-Hallucinations-Detection/. (Fixed typos)