针对欺诈与网络犯罪情景的人类智能滥用多轮评估框架
计算机与社会
2026-03-04 v2
摘要
人工智能正日益被用于协助欺诈和网络犯罪。然而,当前大型语言模型在为复杂犯罪活动提供有用信息的程度尚不明了。我们与执法部门和政策专家合作,开发了针对三种欺诈和网络犯罪情景(情感骗局、CEO 冒充、身份盗窃)的多轮评估。我们的评估聚焦于文本到文本 的交互。在每种情景下,我们评估模型是否提供超出网络上通常可获得信息的可操作性帮助,由领域专家进行评估。我们以贴近实际滥用方式进行设计,例如将欺诈请求分解为一系列看似良性查询的序列。我们发现:(1) 当前大型语言模型在不使用高级越狱技术的情况下,为欺诈和网络犯罪提供的可操作信息极少;(2) 模型安全措施对信息提供有显著影响,使用经 fine-tune 移除安全防护的两个开源大型语言模型提供了最具可操作性和实用性的响应;(3) 将请求分解为看似良性的查询比明确的恶意表述或基础系统级越狱更能获取帮助。总体而言,结果表明,在不进行广泛规避安全措施的情况下,当前的文本生成模型对通过信息提供方式而言,为欺诈和网络犯罪提供的提升相对有限。这项工作贡献了一个可复现、以专家为导向的框架,用于跟踪这些风险如何随着模型能力提升和对手方法演化而变化。
引用
@article{arxiv.2602.21831,
title = {A Multi-Turn Framework for Evaluating AI Misuse in Fraud and Cybercrime Scenarios},
author = {Kimberly T. Mai and Anna Gausen and Magda Dubois and Mona Murad and Bessie O'Dell and Nadine Staes-Polet and Christopher Summerfield and Andrew Strait},
journal= {arXiv preprint arXiv:2602.21831},
year = {2026}
}