VirtualCrime:通过沙盒模拟评估大语言模型的犯罪潜力
密码学与安全
2026-05-20 v3
摘要
大语言模型(LLMs)在多步决策、规划和行动方面展现出强大能力,并日益融入各种现实世界应用中。其强大的问题解决能力是否可能被滥用于犯罪,令人担忧。为解决这一空白,我们提出了 VirtualCrime,一个基于三智能体系统的沙盒模拟框架,用于评估模型的犯罪能力。具体而言,该框架由一个扮演犯罪团队首领的攻击者智能体、一个判定每项行动结果的法官智能体,以及一个更新环境状态和实体的世界管理智能体组成。此外,我们在此框架内设计了 40 项多样化的犯罪任务,涵盖 11 张地图和 13 种犯罪目标,如盗窃、抢劫、绑架和暴乱。我们还引入了人类玩家基线作为参考,以更好地解读 LLM 智能体的表现。我们评估了 8 个强大的 LLM,发现:(1) 模拟环境中的所有智能体都顺从地生成了详细计划并执行了智能化的犯罪过程,部分智能体取得了相对较高的成功率;(2) 在某些情况下,智能体为实现目标会对 NPC 采取造成伤害的严重行动。我们的工作凸显了在现实世界环境中部署智能体 AI 时进行安全对齐的必要性。
引用
@article{arxiv.2601.13981,
title = {VirtualCrime: Evaluating Criminal Potential of Large Language Models via Sandbox Simulation},
author = {Yilin Tang and Yu Wang and Lanlan Qiu and Wenchang Gao and Yunfei Ma and Baicheng Chen and Tianxing He},
journal= {arXiv preprint arXiv:2601.13981},
year = {2026}
}
备注
This manuscript is withdrawn by the authors due to a substantial revision. An updated version will be made available once revisions are complete