中文

TSHA:可信安全危害评估场景下视觉语言模型的基准

计算机视觉与模式识别 2026-04-01 v1 人工智能

摘要

近期视觉语言模型(VLM)的进展加速了其在室内安全危害评估中的应用。然而,现有基准存在三个根本局限:(1)高度依赖通过仿真软件构建的合成数据集,导致与真实环境之间存在显著的领域差距;(2)过于简化的安全任务,对危害和场景类型施加人工限制,限制了模型的可推广性;(3)缺乏严格的评估协议,对复杂家庭安全场景下的模型能力进行彻底评估。为此,我们引入 TSHA(可信安全危害评估),包括 81,809 个精心挑选的训练样本,来源于四个互补来源:现有室内数据集、互联网图像、AIGC 图像和全新收集的图像。该基准集合还包括一个高度具挑战的测试集,包含 1707 个样本:不仅包含从训练分布中精心挑选的子集,还新增了视频和全景图像,包含多项安全危害,用于评估模型在复杂安全场景中的鲁棒性。对 23 个流行 VLM 进行大规模实验,表明当前 VLM 在安全危害评估方面缺乏鲁棒能力。重要的是,使用 TSHA 训练集训练的模型不仅在 TSHA 测试集上实现最高提升 18.3 分,而且在其他基准上展现出增强的可推广性,凸显了 TSHA 基准的重大贡献与重要性。

关键词

引用

@article{arxiv.2603.29759,
  title  = {TSHA: A Benchmark for Visual Language Models in Trustworthy Safety Hazard Assessment Scenarios},
  author = {Qiucheng Yu and Ruijie Xu and Mingang Chen and Xuequan Lu and Jianfeng Dong and Chaochao Lu and Xin Tan},
  journal= {arXiv preprint arXiv:2603.29759},
  year   = {2026}
}