使多模态大语言模型失明:MLLM 内容审核中的对抗性走私攻击
计算机视觉与模式识别
2026-04-10 v2
摘要
多模态大语言模型(MLLM)正越来越多地被部署为自动内容审核者。在这一领域中,我们发现了一个关键威胁:对抗性走私攻击(Adversarial Smuggling Attacks)。与对抗性扰动(用于错误分类)和对抗性越狱(用于生成有害输出)不同,对抗性走私利用人类-AI 能力差距。它将有害内容编码为人类可读但 AI 无法读取的视觉格式,从而规避自动检测并使有害内容的传播成为可能。我们将走私攻击分为两条路径:(1)感知盲区(Perceptual Blindness),破坏文本识别;以及(2)推理阻断(Reasoning Blockade),尽管成功识别文本但抑制语义理解。为了评估这一威胁,我们构建了 SmuggleBench——第一个包含 1,700 个对抗性走私攻击实例的综合性基准。在 SmuggleBench 上的评估表明,专有模型(如 GPT-5)和开源模型(如 Qwen3-VL)等最先进模型都容易受到此威胁,攻击成功率(ASR)超过 90%。通过从感知和推理的角度分析漏洞,我们确定了三个根本原因:视觉编码器的能力有限、OCR 的鲁棒性差距以及领域特定对抗样本的稀缺。我们对缓解策略进行了初步探索,研究了通过思维链(CoT)进行的测试时缩放和通过监督微调(SFT)进行的对抗训练来缓解此威胁的潜力。我们的代码在 https://github.com/zhihengli-casia/smugglebench 公开可用。
引用
@article{arxiv.2604.06950,
title = {Making MLLMs Blind: Adversarial Smuggling Attacks in MLLM Content Moderation},
author = {Zhiheng Li and Zongyang Ma and Yuntong Pan and Ziqi Zhang and Xiaolei Lv and Bo Li and Jun Gao and Jianing Zhang and Chunfeng Yuan and Bing Li and Weiming Hu},
journal= {arXiv preprint arXiv:2604.06950},
year = {2026}
}
备注
Accepted to ACL 2026. 19 pages, 6 figures