从大语言模型到多模态大语言模型:探索多模态对抗性攻击的广阔图景
计算与语言
2024-06-24 v1 人工智能
摘要
大型语言模型(LLMs)和多模态大型语言模型(MLLMs)的快速发展暴露了它们面临各种对抗性攻击的漏洞。本文提供了针对 LLMs 和 MLLMs 的越狱研究的全面概述,突出了近期在评估基准、攻击技术和防御策略方面的最新进展。与单模态越狱研究相对更为成熟的状态相比,多模态领域仍有待探索。我们总结了多模态越狱的局限性和潜在研究方向,旨在激发未来研究并进一步提升 MLLMs 的鲁棒性和安全性。
引用
@article{arxiv.2406.14859,
title = {From LLMs to MLLMs: Exploring the Landscape of Multimodal Jailbreaking},
author = {Siyuan Wang and Zhuohan Long and Zhihao Fan and Zhongyu Wei},
journal= {arXiv preprint arXiv:2406.14859},
year = {2024}
}