安全输入却产生不安全输出:大型视觉语言模型跨模态安全对齐的基准测试
人工智能
2025-02-18 v2 计算与语言
摘要
随着人工通用智能(AGI)越来越多地融入人类生活的各个方面,确保此类系统的安全性和伦理对齐至关重要。以往的研究主要关注单模态威胁,可能不足以应对跨模态交互的集成性和复杂性。我们提出了一种新颖的安全对齐挑战,称为Safe Inputs but Unsafe Output(SIUO),以评估跨模态安全对齐。具体而言,它考虑单一模态独立安全但可能在组合后导致不安全或不伦理输出的情况。为实证探讨此问题,我们开发了SIUO,一个涵盖9个关键安全领域的跨模态基准测试,如自伤、非法活动和隐私侵犯。我们的发现表明,无论是封闭式还是开源的大型视觉语言模型(如GPT-4V和LLaVA),在处理复杂真实场景时都存在显著的安全漏洞,凸显当前模型可靠解释和应对此类情境的不足。
引用
@article{arxiv.2406.15279,
title = {Safe Inputs but Unsafe Output: Benchmarking Cross-modality Safety Alignment of Large Vision-Language Model},
author = {Siyin Wang and Xingsong Ye and Qinyuan Cheng and Junwen Duan and Shimin Li and Jinlan Fu and Xipeng Qiu and Xuanjing Huang},
journal= {arXiv preprint arXiv:2406.15279},
year = {2025}
}