Odysseus:通过双重隐写术突破商业多模态LLM集成系统
密码学与安全
2025-12-24 v1 人工智能
机器学习
摘要
将语言理解与图像等感知模态集成的多模态大语言模型(MLLMs)构成现代AI系统,尤其是运行于开放和交互式环境中的智能代理的关键基石。然而,其日益普及的可访问性也带来了滥用风险,如生成有害或不安全内容。为缓解这些风险,常用于将模型行为对齐人类价值观。尽管如此,近期研究表明,越狱攻击可绕过对齐措施,诱导不安全输出。目前,大多数越狱方法针对开源模型设计,针对商业MLLM集成系统的有效性有限,这些系统常采用额外的过滤器。这些过滤器可检测并防止恶意输入和输出内容,显著降低了越狱威胁。本文揭示,这些安全过滤器的成功依赖于一个关键假设:恶意内容必须在输入或输出中显式可见。尽管该假设在传统LLM集成系统中常成立,但在MLLM集成系统中,攻击者可利用多模态手段隐藏对抗意图,从而在现有MLLM集成系统中制造安全过滤器的虚假安全感。为挑战这一假设,我们提出Odysseus,一种新型越狱范式,通过双重隐写术将恶意查询和响应隐蔽地嵌入看似善意的图像中。大量基准实验表明,Odysseus成功地突破了多个先进且真实的MLLM集成系统,达到最高99%的攻击成功率。它暴露了现有防御的根本性盲点,呼吁重新思考MLLM集成系统中的跨模态安全。
引用
@article{arxiv.2512.20168,
title = {Odysseus: Jailbreaking Commercial Multimodal LLM-integrated Systems via Dual Steganography},
author = {Songze Li and Jiameng Cheng and Yiming Li and Xiaojun Jia and Dacheng Tao},
journal= {arXiv preprint arXiv:2512.20168},
year = {2025}
}
备注
This paper is accepted by Network and Distributed System Security Symposium (NDSS) 2026