AIGC 亦能迷惑 AI:探究与解释合成图像引发的大型视觉语言模型幻觉
计算机视觉与模式识别
2024-09-04 v2
摘要
人工智能生成内容(AIGCs)的演进正迈向更高质量。与 AIGC 日益增长的交互给数据驱动的 AI 社区带来了新挑战:尽管 AI 生成内容已在广泛的 AI 模型中扮演关键角色,但其引入的潜在隐藏风险尚未得到彻底审视。除了面向人类的伪造检测之外,AI 生成内容还给原本设计用于处理自然数据的 AI 模型带来了潜在问题。在本研究中,我们强调了由 AI 合成图像引发的大型视觉语言模型(LVLMs)中加剧的幻觉现象。值得注意的是,我们的发现揭示了一种一致的 AIGC **幻觉偏差**:合成图像引发的物体幻觉具有数量更多、位置分布更均匀的特征,即使这些合成图像相较于自然图像并未表现出不切实际或额外的相关视觉特征。此外,我们对 Q-former 和线性投影器的研究表明,合成图像在视觉投影后可能出现 token 偏差,从而放大了幻觉偏差。
引用
@article{arxiv.2403.08542,
title = {AIGCs Confuse AI Too: Investigating and Explaining Synthetic Image-induced Hallucinations in Large Vision-Language Models},
author = {Yifei Gao and Jiaqi Wang and Zhiyu Lin and Jitao Sang},
journal= {arXiv preprint arXiv:2403.08542},
year = {2024}
}