当文本劫持视觉:面向视觉-语言模型的文本叠加诱导幻觉基准测试与缓解
计算机视觉与模式识别
2026-04-21 v1 人工智能
摘要
近期视觉-语言模型(VLM)的进展显著提升了其在跨模态视频理解基准测试中的能力,这些基准测试涵盖时间、动作、对象和空间理解。然而,我们发现了一个被严重忽视的关键问题:当嵌入屏幕上的文本与视觉场景相矛盾时,现有 VLM 系统会系统性地产生幻觉,优先考虑叠加文本的语义而非实际视觉内容。我们将这一现象定义为文本叠加诱导幻觉(TOIH)。本文提出 VisualTextTrap,即第一个全面基准测试,包含大规模人类验证样本,并配备专为评估设计的度量标准。具体而言,我们利用 VLM 辅助文本生成与严格人工验证的可扩展混合管道构建 VisualTextTrap。基准测试包含 6,057 个样本,覆盖 88 个细粒度属性,分为四个维度;幻觉强度按五档(L1--L5)进行量化,反映叠加文本与视觉现实之间的语义矛盾程度。此外,我们提出 Visual Text Hallucination Mitigation Mixture-of-Experts(VTHM-MoE),一种新型视觉-文本解�合框架,采用双编码器架构。具体地,四个维度专用专家模块(时间、动作、对象、空间推理)首先进行预训练,以识别并利用文本语义与实际视频内容之间的跨模态差异。我们开发了自适应 token 路由策略,以实现动态专家分配,具备对 TOIH 的强大抗性,同时保持对未受污染视频的性能。广泛在 VisualTextTrap 基准测试上的实验表明,VTHM-MoE 在各种视频问答任务中均优于最先进的对手。
引用
@article{arxiv.2604.17375,
title = {When Text Hijacks Vision: Benchmarking and Mitigating Text Overlay-Induced Hallucination in Vision Language Models},
author = {Cui Yakun and Xingqun Qi and TianTian Geng and Yuyao Zhang and Sirui Han and Yike Guo},
journal= {arXiv preprint arXiv:2604.17375},
year = {2026}
}