大语言模型是优秀的安全代理,还是宣传机器?
计算与语言
2025-12-01 v1
摘要
大型语言模型(LLMs)被训练以拒绝回答有害内容。然而,缺乏对这种行为是否真正反映其安全政策,或是否表明其在全球范围内实施的政治审查的系统性分析。区分安全驱动的拒绝与政治审查行为在困惑且不明确。为此目的,我们引入了PSP数据集,旨在从明确的政治语境中探测LLM的拒绝行为。PSP通过两个数据来源(中国敏感提示的通用化至多个国家,以及来自多个国家的被审查推文)构建。我们研究:1)通过数据驱动(使PSP隐式化)和表示水平方法(擦除政治概念)对七个LLM的政治敏感性影响;2)通过提示注入攻击(PIA)测试模型在PSP上的脆弱性。将审查与带隐式意图内容的拒绝关联,我们发现大多数LLM执行某种形式的审查。我们随后总结了导致不同模型和不同国家情境下拒绝分布发生变化的主要属性。
引用
@article{arxiv.2511.23174,
title = {Are LLMs Good Safety Agents or a Propaganda Engine?},
author = {Neemesh Yadav and Francesco Ortu and Jiarui Liu and Joeun Yook and Bernhard Schölkopf and Rada Mihalcea and Alberto Cazzaniga and Zhijing Jin},
journal= {arXiv preprint arXiv:2511.23174},
year = {2025}
}
备注
15 pages, 7 tables, 4 figures