中文

Omni-SafetyBench:面向音视频大语言模型安全评估的综合基准

计算与语言 2025-09-30 v2

摘要

Omni-modal 大型语言模型(OLLMs)的兴起将视觉和听觉处理与文本集成, necessitates robust safety 评估以缓解有害输出。然而,目前没有针对 OLLMs 的专门基准,现有基准也无法评估在联合 audio-visual 输入下或跨模态一致性的安全性。为填补这一空白,我们引入 Omni-SafetyBench,首个综合性 OLLM 安全评估平行基准, featuring 24 种模态变体,每个变体包含 972 个样本,包括 audio-visual 有害案例。考虑到 OLLMs 对复杂 omni-modal 输入的 comprehension 挑战以及对跨模态一致性评估的需要,我们提出了量身定制的指标:基于 Conditional Attack Success Rate(C-ASR)和 Refusal Rate(C-RR)的 Safety-score 以 accounts for comprehension 失败,以及衡量跨模态一致性的 Cross-Modal Safety Consistency score(CMSC-score)。评估 6 个开源和 4 个闭源 OLLMs 揭示了关键漏洞:(1)只有 3 个模型 在 average Safety-score 和 CMSC-score 中两者都超过 0.6;(2)安全防御在复杂输入下会减弱,尤其是 audio-visual 联合;(3)仍存严重弱点,部分模型在特定模态上得分最低至 0.14。使用 Omni-SafetyBench,我们评估了现有的 safety alignment 算法,识别了 OLLM 安全对齐中的关键挑战:(1)Inference-time 方法 本质上 less effective,因为它们无法改变模型对 safety 的底层理解;(2)Post-training 方法 由于 OLLMs 的庞大模态组合, struggles with out-of-distribution 问题;(3)涉及 audio-visual 输入的 safety 任务 更为复杂,即使 in-distribution 训练数据也不够有效。我们提出的 benchmark、metrics 和发现 凸显了加强 OLLM 安全的紧迫需求。

关键词

引用

@article{arxiv.2508.07173,
  title  = {Omni-SafetyBench: A Benchmark for Safety Evaluation of Audio-Visual Large Language Models},
  author = {Leyi Pan and Zheyu Fu and Yunpeng Zhai and Shuchang Tao and Sheng Guan and Shiyu Huang and Lingzhe Zhang and Zhaoyang Liu and Bolin Ding and Felix Henry and Aiwei Liu and Lijie Wen},
  journal= {arXiv preprint arXiv:2508.07173},
  year   = {2025}
}

备注

22 pages, 10 figures, 12 tables