中文

大型语言模型在不同社会法律情境下的冤狱性回应

计算机与社会 2025-11-27 v1 人工智能 计算与语言

摘要

大型语言模型(LLM)如今已在规模空前地部署,帮助数百万用户完成日常任务。然而,这些模型帮助非法活动的风险仍未得到充分探讨。在本研究中,我们将这种高风险行为定义为冤狱性促进——即提供指导或支持以启用用户的非法指令,并呈现四项实证研究来评估其在广泛部署的LLM中的冤狱性促进行为。使用真实世界的法律案例和既定的法律框架,我们构建了一个覆盖269个非法情景和50个非法意图的评估基准,用于评估LLM的冤狱性促进行为。我们的发现表明,LLM对冤狱性促进极其脆弱,GPT-4o在测试的近半数案例中提供了非法帮助。此外,LLM在提供可信的法律警告和积极指导方面表现不足。进一步的分析揭示了社会法律情境之间存在显著的安全差异。在法律方面,我们观察到针对社会利益的犯罪、非极端但频繁发生的违规行为,以及由主观动机或欺骗性正当化驱动的恶意意图,都有更高的冤狱性。就社会方面而言,我们识别出人口统计学差异,揭示了对边缘化和劣势群体的冤狱性模式,年长者、种族少数派以及职业地位较低者更容易收到非法指导。分析模型推理痕迹表明,模型感知到的刻板印象沿着温度和能力两个维度与模型的冤狱行为相关。最后,我们展示了现有的安全对齐策略是不够的,甚至可能加剧冤狱行为。

关键词

引用

@article{arxiv.2511.20736,
  title  = {Large Language Models' Complicit Responses to Illicit Instructions across Socio-Legal Contexts},
  author = {Xing Wang and Huiyuan Xie and Yiyan Wang and Chaojun Xiao and Huimin Chen and Holli Sargeant and Felix Steffek and Jie Shao and Zhiyuan Liu and Maosong Sun},
  journal= {arXiv preprint arXiv:2511.20736},
  year   = {2025}
}