中文

PRISON:揭示大型语言模型的犯罪潜力

密码学与安全 2025-10-20 v3 人工智能 计算与语言

摘要

随着大型语言模型(LLM)的发展,关于其在复杂社交情境中不当行为的担忧日益加剧。现有研究忽略了对其在真实交互中犯罪能力的系统性理解和评估。我们提出了统一框架PRISON,用于量化LLM在五个维度上的犯罪潜力:虚假陈述、构陷陷害、心理操纵、情感伪装和道德解耦。使用结构化犯罪情景(改编自现实情境下的经典电影),我们评估了LLM的犯罪潜力和反犯罪能力。结果显示,最先进的LLM经常表现出涌现出的犯罪倾向,例如提出误导性陈述或逃避策略,甚至在没有明确指令的情况下也如此。此外,当被置于侦探角色时,模型仅在44%的平均准确率下识别deceptive behavior,揭示了在执行和检测犯罪行为之间呈现出显著的不匹配。这些发现凸显了在更广泛的LLM部署之前,对抗鲁棒性、行为对齐和安全机制的紧迫需求。

关键词

引用

@article{arxiv.2506.16150,
  title  = {PRISON: Unmasking the Criminal Potential of Large Language Models},
  author = {Xinyi Wu and Geng Hong and Pei Chen and Yueyue Chen and Xudong Pan and Min Yang},
  journal= {arXiv preprint arXiv:2506.16150},
  year   = {2025}
}