ELITE:面向安全的增强型语言-图像毒性评估
计算机视觉与模式识别
2025-07-25 v3 计算与语言
摘要
当前的视觉语言模型(VLMs)仍然容易受到恶意提示的影响,从而产生有害输出。现有的VLM安全基准主要依赖于自动化评估方法,但这些方法难以检测隐含的有害内容或产生不准确的评估。因此,我们发现现有基准存在有害性水平低、数据模糊以及图像-文本对组合多样性有限等问题。为了解决这些问题,我们提出了ELITE基准,这是一个高质量的VLM安全评估基准,并由我们增强的评估方法——ELITE评估器提供支持。ELITE评估器明确引入了毒性分数,以准确评估多模态上下文中的有害性,因为在这些上下文中,VLM通常会对图像提供具体、有说服力但无害的描述。我们使用ELITE评估器从现有基准中过滤掉模糊和低质量的图像-文本对,并生成安全与不安全图像-文本对的多样化组合。我们的实验表明,与先前的自动化方法相比,ELITE评估器在评估上与人类评估的一致性更高,并且ELITE基准提供了更高的基准质量和多样性。通过引入ELITE,我们为更安全、更稳健的VLM铺平了道路,为评估和缓解现实世界应用中的安全风险提供了关键工具。
引用
@article{arxiv.2502.04757,
title = {ELITE: Enhanced Language-Image Toxicity Evaluation for Safety},
author = {Wonjun Lee and Doehyeon Lee and Eugene Choi and Sangyoon Yu and Ashkan Yousefpour and Haon Park and Bumsub Ham and Suhyun Kim},
journal= {arXiv preprint arXiv:2502.04757},
year = {2025}
}
备注
ICML 2025. Project page at https://velpegor.github.io/ELITE/