DeepSeek 在旅途中:通过表示漏洞诱导目标视觉幻觉
计算机视觉与模式识别
2025-02-13 v1 机器学习
摘要
多模态大型语言模型(MLLM)代表了人工智能技术的前沿,DeepSeek 模型正作为开源替代方案涌现,性能与闭源系统相抗衡。尽管这些模型展示了卓越的能力,但其视觉-语言集成机制引入了特定漏洞。我们对 DeepSeek Janus 实施了适应的嵌入操纵攻击,通过系统化优化图像嵌入诱导目标视觉幻觉。通过在 COCO、DALL-E 3 和 SVIT 数据集上进行大量实验,我们实现了最高达 98.0% 的幻觉率,同时保持操纵后图像在 open-ended questions 上的高视觉保真度(SSIM > 0.88)。我们的分析表明,1B 和 7B 变体的 DeepSeek Janus 都容易受到此类攻击,闭式评估显示其幻觉率持续高于 open-ended 提问。我们引入一种新型多提示幻觉检测框架,使用 LLaMA-3.1 8B Instruct 实现稳健评估。鉴于 DeepSeek 的开源性质及其广泛部署潜力,这些发现具有特别令人关注的意义。这项研究强调了在 MLLM 部署管道中从嵌入层面实施安全措施的关键性,并为更广泛的负责任 AI 实施讨论作出了贡献。
引用
@article{arxiv.2502.07905,
title = {DeepSeek on a Trip: Inducing Targeted Visual Hallucinations via Representation Vulnerabilities},
author = {Chashi Mahiul Islam and Samuel Jacob Chacko and Preston Horne and Xiuwen Liu},
journal= {arXiv preprint arXiv:2502.07905},
year = {2025}
}
备注
19 pages, 4 figures