PRISON:揭示大型语言模型的犯罪潜力
密码学与安全
2025-10-20 v3 人工智能
计算与语言
摘要
随着大型语言模型(LLM)的发展,关于其在复杂社交情境中不当行为的担忧日益加剧。现有研究忽略了对其在真实交互中犯罪能力的系统性理解和评估。我们提出了统一框架PRISON,用于量化LLM在五个维度上的犯罪潜力:虚假陈述、构陷陷害、心理操纵、情感伪装和道德解耦。使用结构化犯罪情景(改编自现实情境下的经典电影),我们评估了LLM的犯罪潜力和反犯罪能力。结果显示,最先进的LLM经常表现出涌现出的犯罪倾向,例如提出误导性陈述或逃避策略,甚至在没有明确指令的情况下也如此。此外,当被置于侦探角色时,模型仅在44%的平均准确率下识别deceptive behavior,揭示了在执行和检测犯罪行为之间呈现出显著的不匹配。这些发现凸显了在更广泛的LLM部署之前,对抗鲁棒性、行为对齐和安全机制的紧迫需求。
引用
@article{arxiv.2506.16150,
title = {PRISON: Unmasking the Criminal Potential of Large Language Models},
author = {Xinyi Wu and Geng Hong and Pei Chen and Yueyue Chen and Xudong Pan and Min Yang},
journal= {arXiv preprint arXiv:2506.16150},
year = {2025}
}