失控的伊卡洛斯:多模态大语言模型安全中图像输入潜在风险综述
密码学与安全
2024-08-13 v2 计算机视觉与模式识别
摘要
多模态大语言模型展现出卓越的能力,日益影响我们日常生活的方方面面,不断定义着通用人工智能(AGI)的新边界。与其他模态相比,图像模态蕴含丰富的语义信息且具有更连续的数学性质,在集成后极大增强了 MLLM 的功能。然而,这种集成是一把双刃剑,为攻击者提供了广泛的漏洞以实施高度隐蔽和有害的攻击。追求如强大 MLLM 这样的可靠 AI 系统已成为当代研究的关键领域。在本文中,我们致力于展示将图像模态纳入 MLLM 所带来的多方面风险。首先,我们描述了 MLLM 的基础组件和训练过程。随后,我们构建了一个威胁模型,概述了 MLLM 内在的安全漏洞。此外,我们分析并总结了现有关于 MLLM 攻击与防御机制的学术论述,最终为 MLLM 安全的未来研究提出了建议。通过这项全面分析,我们旨在加深学术界对 MLLM 安全挑战的理解,并推动可信 MLLM 系统的发展。
引用
@article{arxiv.2404.05264,
title = {Unbridled Icarus: A Survey of the Potential Perils of Image Inputs in Multimodal Large Language Model Security},
author = {Yihe Fan and Yuxin Cao and Ziyu Zhao and Ziyao Liu and Shaofeng Li},
journal= {arXiv preprint arXiv:2404.05264},
year = {2024}
}
备注
8 pages, 1 figure. Accepted to 2024 IEEE International Conference on Systems, Man, and Cybernetics