LieCraft:用于评估语言模型欺骗能力的多智能体框架
人工智能
2026-03-10 v1 计算与语言
摘要
大型语言模型(LLM)展现出惊人的通用能力,但也带来了严重的安全风险,尤其是模型获取自主性并减少人类监督后,潜在的欺骗行为。本文提出了LieCraft:一种用于衡量LLM欺骗的新型评估框架和沙箱,旨在解决先前基于游戏的评估方法的局限。LieCraft的核心是一种新的多玩家隐藏角色游戏,玩家选择伦理取向并在长时间范围内执行策略以完成任务。合作者协作解决事件挑战并揭露坏行为者,而背叛者则规避怀疑,同时暗中破坏任务。为实现现实相关性,我们开发了10个具体情景(如儿童护理、医院资源分配和贷款放贷),将底层机制重新置于伦理关键且高风险的领域。通过精心设计游戏机制和奖励结构,确保LieCraft的平衡 gameplay,激励有意义的战略选择,同时消除退化策略。除了框架本身之外,我们报告了来自12个最先进LLM在三个行为轴上的结果:缺陷倾向、欺骗技能和指控准确性。我们的发现表明,尽管各模型在能力和整体对齐方面存在差异,所有模型都愿意不道德地行事、隐藏意图并出于目的而说谎。
引用
@article{arxiv.2603.06874,
title = {LieCraft: A Multi-Agent Framework for Evaluating Deceptive Capabilities in Language Models},
author = {Matthew Lyle Olson and Neale Ratzlaff and Musashi Hinck and Tri Nguyen and Vasudev Lal and Joseph Campbell and Simon Stepputtis and Shao-Yen Tseng},
journal= {arXiv preprint arXiv:2603.06874},
year = {2026}
}
备注
AAAI 2026 Alignment track. Authors 1 and 2 contributed equally, 3 and 4 contributed equally, 6 and 7 and 8 contributed equally (ordered by last name)