SocialHarmBench:揭示LLM对社会有害请求的脆弱性
计算与语言
2026-02-24 v2 人工智能
机器学习
摘要
大型语言模型 (LLMs) 日益部署在可能产生直接社会政治后果的环境中。然而,现有的安全基准很少测试在政治操纵、宣传与虚假信息生成或监控与信息控制等领域的脆弱性。我们提出了 SocialHarmBench,一个包含 585 个提示的数据集,涵盖 7 个社会政治类别和 34 个国家,旨在揭示 LLMs 在政治敏感语境中最严重的失败之处。我们的评估揭示了若干不足:开放权重模型在有害遵从方面表现出高度脆弱性,Mistral-7B 在历史修正主义、宣传和政治操纵等领域的攻击成功率高达 97% 至 98%。此外,时空分析表明,当面对 21 世纪或 20 世纪之前的语境以及与拉丁美洲、美国和英国等地区相关的提示时,LLMs 最为脆弱。这些发现表明当前的防护措施无法泛化到高风险的社会政治环境,暴露了系统性偏差,并引发了对 LLMs 在维护人权和民主价值方面可靠性的担忧。我们在 https://huggingface.co/datasets/psyonp/SocialHarmBench 分享了 SocialHarmBench 基准。
引用
@article{arxiv.2510.04891,
title = {SocialHarmBench: Revealing LLM Vulnerabilities to Socially Harmful Requests},
author = {Punya Syon Pandey and Hai Son Le and Devansh Bhardwaj and Rada Mihalcea and Zhijing Jin},
journal= {arXiv preprint arXiv:2510.04891},
year = {2026}
}
备注
ICLR 2026