中文

面向视觉语言模型的全面安全偏好对齐数据集 SPA-VL

计算机视觉与模式识别 2025-05-22 v4 人工智能 计算与语言

摘要

视觉语言模型 (VLM) 的出现带来了对多模态信息理解的突破性进展。VLM 将文本与视觉语义组合的复杂性和多样性使得这些模型的安全对齐具有挑战性。此外,由于对 VLM 安全对齐的研究有限,缺乏大规模高质量的数据集。为此,我们提出了面向视觉语言模型的安全偏好对齐数据集,命名为 SPA-VL。从广度来看,SPA-VL 覆盖 6 大类危害领域、13 个类别和 53 个子类别,包含 100,788 个四元组样本(问题、图像、被选响应、被拒绝响应)。从深度来看,响应来自 12 个开源(如 QwenVL)和闭源(如 Gemini) VLM,以确保多样性。偏好数据的构建是完全自动化的,实验结果表明,在 SPA-VL 数据集上进行对齐技术训练的模型在保持核心能力的同时,显著改善了无害性和有用性。作为大规模、高质量且多样化的数据集,SPA-VL 标志着确保 VLM 同时实现无害性和有用性的重要里程碑。

关键词

引用

@article{arxiv.2406.12030,
  title  = {SPA-VL: A Comprehensive Safety Preference Alignment Dataset for Vision Language Model},
  author = {Yongting Zhang and Lu Chen and Guodong Zheng and Yifeng Gao and Rui Zheng and Jinlan Fu and Zhenfei Yin and Senjie Jin and Yu Qiao and Xuanjing Huang and Feng Zhao and Tao Gui and Jing Shao},
  journal= {arXiv preprint arXiv:2406.12030},
  year   = {2025}
}