中文

自动化安全基准测试:面向大型视觉语言模型(LVLMs)的多智能体管道

计算与语言 2026-01-28 v1

摘要

大型视觉语言模型(LVLMs)在跨模态任务中展现出惊人的能力,但面临显著的安全挑战,这些挑战削弱了其在实际应用中的可靠性。为此,已致力于构建 LVLMs 安全评估基准以揭示其脆弱性。然而,现有基准受限于耗时的构建过程、静态复杂性和有限的判别能力。它们可能无法跟上快速演进的模型和新兴风险。为此,我们提出 VLSafetyBencher,即首个实现 LVLMs 自动化安全基准测试系统。VLSafetyBencher 引入四个协作智能体:数据预处理、生成、增强和选择智能体,以构建和筛选高质量样本。实验表明,VLSafetyBencher 可在低成本下一周内构建高质量安全基准。生成的基准有效区分安全性,在最安全和最不安全模型之间实现了 70% 的安全率差异。

关键词

引用

@article{arxiv.2601.19507,
  title  = {Automated Safety Benchmarking: A Multi-agent Pipeline for LVLMs},
  author = {Xiangyang Zhu and Yuan Tian and Zicheng Zhang and Qi Jia and Chunyi Li and Renrui Zhang and Heng Li and Zongrui Wang and Wei Sun},
  journal= {arXiv preprint arXiv:2601.19507},
  year   = {2026}
}