中文

SEA:通过合成嵌入实现多模态大语言模型的低资源安全对齐

计算与语言 2025-06-04 v3 密码学与安全 多媒体

摘要

多模态大语言模型(MLLM)面临严重的安全漏洞。虽然使用包含文本和其他模态数据的数字的安全对齐数据集可以有效增强 MLLM 的安全性,但构建这些数据集的成本很高。现有的低资源安全对齐方法,包括文本对齐,被发现在应对来自其他模态的安全风险方面存在困难。为此,我们提出 Synthetic Embedding augmented safety Alignment(SEA),通过对额外模态的嵌入进行梯度更新来扩充文本数据集。这使得即使仅使用文本数据也能进行多模态安全对齐训练。在图像、视频和音频基础的 MLLM 上进行的大量实验表明,SEA 能在 24 秒内在单个 RTX3090 GPU 上合成高质量的嵌入。SEA 在面对来自其他模态的威胁时显著提高了 MLLM 的安全性。为评估视频和音频引入的安全风险,我们还引入了一个新的基准称为 VA-SafetyBench。来自多个 MLLM 的高攻击成功率验证了其挑战性。我们的代码和数据将在 https://github.com/ZeroNLP/SEA 提供。

关键词

引用

@article{arxiv.2502.12562,
  title  = {SEA: Low-Resource Safety Alignment for Multimodal Large Language Models via Synthetic Embeddings},
  author = {Weikai Lu and Hao Peng and Huiping Zhuang and Cen Chen and Ziqian Zeng},
  journal= {arXiv preprint arXiv:2502.12562},
  year   = {2025}
}

备注

Accepted in ACL 2025 Main Track