中文

Falcon:一个用于全面安全感知的跨模态评估数据集

人工智能 2025-09-30 v1

摘要

评估大型语言模型(LLMs)生成内容的有害性的现有方法已被充分研究。然而,针对多模态大型语言模型(MLLMs)的方法仍不成熟且缺乏深度。这项工作强调了视觉信息在调节视觉问答(VQA)内容中的关键作用,这是当前研究中常被忽视的一个维度。为填补这一空白,我们引入了 Falcon,一个大规模的视觉-语言安全数据集,包含 13 个有害类别中的 57,515 个 VQA 对。该数据集为图像、指令和响应中的有害属性提供了明确注释,从而便于对 MLLMs 生成的内容进行全面评估。此外,它还包含相关的有害类别以及支持相应判断的解释。我们进一步提出了 FalconEye,一个使用 Falcon 数据集从 Qwen2.5-VL-7B 微调而来的专用评估器。实验结果表明,FalconEye 能够在复杂且安全关键的多模态对话场景中可靠地识别有害内容。它在我们提出的 Falcon-test 数据集和两个广泛使用的基准——VLGuard 和 Beavertail-V——的整体准确率上超越了所有其他基线,突显了其作为 MLLMs 实用安全审计工具的潜力。

关键词

引用

@article{arxiv.2509.23783,
  title  = {Falcon: A Cross-Modal Evaluation Dataset for Comprehensive Safety Perception},
  author = {Qi Xue and Minrui Jiang and Runjia Zhang and Xiurui Xie and Pei Ke and Guisong Liu},
  journal= {arXiv preprint arXiv:2509.23783},
  year   = {2025}
}