中文

当帮助者成为危险:分析多模态LLM在日常生活中安全性的基准

计算与语言 2026-04-21 v2

摘要

随着多模态大语言模型(MLLM)成为人类生活中必不可少的助手,由MLLM生成的不安全内容对人类行为构成威胁,悬挂于人类社会之上如同大宫殿之剑。为调查和评估MLLM响应对人类日常生活中人类行为的安全影响,我们引入SaLAD,一个包含2,013个真实世界图像-文本样本的多模态安全基准,覆盖10个常见类别,均衡设计覆盖不安全场景和过度敏感案例。它强调真实风险暴露、真实视觉输入和细粒度跨模态推理,确保安全风险无法仅从文本推断。我们进一步提出了基于安全警告的评估框架,该框架鼓励模型提供清晰且有信息的安全警告,而非通用拒绝。对18个MLLM的测试结果表明,表现最好的模型仅在不安全查询上实现57.2%的安全响应率。此外,even popular的安全对齐方法在本场景中限制了模型的效果,揭示了当前MLLM在识别日常生活中危险行为方面的漏洞。我们的数据集可在https://github.com/xinyuelou/SaLAD获取。

关键词

引用

@article{arxiv.2601.04043,
  title  = {When Helpers Become Hazards: A Benchmark for Analyzing Multimodal LLM-Powered Safety in Daily Life},
  author = {Xinyue Lou and Jinan Xu and Jingyi Yin and Xiaolong Wang and Zhaolu Kang and Youwei Liao and Yixuan Wang and Xiangyu Shi and Fengran Mo and Su Yao and Kaiyu Huang},
  journal= {arXiv preprint arXiv:2601.04043},
  year   = {2026}
}

备注

Accepted by ACL 2026 (Findings)