中文

从大语言模型到多模态大语言模型:探索多模态对抗性攻击的广阔图景

计算与语言 2024-06-24 v1 人工智能

摘要

大型语言模型(LLMs)和多模态大型语言模型(MLLMs)的快速发展暴露了它们面临各种对抗性攻击的漏洞。本文提供了针对 LLMs 和 MLLMs 的越狱研究的全面概述,突出了近期在评估基准、攻击技术和防御策略方面的最新进展。与单模态越狱研究相对更为成熟的状态相比,多模态领域仍有待探索。我们总结了多模态越狱的局限性和潜在研究方向,旨在激发未来研究并进一步提升 MLLMs 的鲁棒性和安全性。

关键词

引用

@article{arxiv.2406.14859,
  title  = {From LLMs to MLLMs: Exploring the Landscape of Multimodal Jailbreaking},
  author = {Siyuan Wang and Zhuohan Long and Zhihao Fan and Zhongyu Wei},
  journal= {arXiv preprint arXiv:2406.14859},
  year   = {2024}
}