有害内容被伪装时:揭示 LVLMs 对 CamHarmTI 的感知失败
多媒体
2025-12-04 v1 人工智能
摘要
大视觉语言模型(LVLMs)越来越多地用于检测多模态有害内容的任务,例如在线内容审核。然而,真实世界的有害内容常常被伪装,依赖微妙的文本-图像交互,如模因或嵌入恶意文本的图像,以规避检测。这引发了一个关键问题:\textbf{LVLMs 能否像人类一样敏感地感知这种伪装的有害内容?} 在本文中,我们引入了 CamHarmTI,一个用于评估 LVLM 在文本-图像组合中感知和解释伪装有害内容能力的基准。CamHarmTI 包含超过 4,500 个样本,涵盖三种类型的图文帖子。在 100 名人类用户和 12 个主流 LVLM 上进行的实验揭示了一个明显的感知差距:人类轻松识别此类内容(例如准确率超过 95.75%),而当前的 LVLM 往往失败(例如 ChatGPT-4o 仅达到 2.10% 的准确率)。此外,微调实验表明 \bench 是提高模型感知的有效资源,将 Qwen2.5VL-7B 的准确率提高了 55.94%。注意力分析和逐层探测进一步表明,微调主要增强了视觉编码器早期层的敏感性,促进了更整合的场景理解。这些发现揭示了 LVLMs 中固有的感知局限性,并为更对齐人类视觉推理系统提供了见解。
引用
@article{arxiv.2512.03087,
title = {When Harmful Content Gets Camouflaged: Unveiling Perception Failure of LVLMs with CamHarmTI},
author = {Yanhui Li and Qi Zhou and Zhihong Xu and Huizhong Guo and Wenhai Wang and Dongxia Wang},
journal= {arXiv preprint arXiv:2512.03087},
year = {2025}
}