中文

“火星人”: 用于衡量与检测代理性欺骗的沙盒

人工智能 2026-02-11 v3 机器学习

摘要

过去的研究通常评估语言-based AI 智能体是否生产关于某个主题的虚假陈述,或是否在由目标驱动的二元选择中作出决定,而不是允许在追求更长期目标的过程中展现开放性的欺骗行为。为此,我们引入了“火星人”(Among Us),这是一个社交欺骗游戏沙盒,LLM 智能体因游戏目标而展现出长期、开放性的欺骗行为。虽然大多数基准测试很快就会饱和,但“火星人”预计能持续更长时间,因为这是一场远离平衡态的多玩家游戏。我们利用该沙盒评估了 18 种专有和开源权重的 LLM,发现一个普遍趋势:在 RL 训练的模型在生产欺骗方面优于检测方面。我们评估了检测谎言和欺骗的方法:基于激活值的逻辑回归和稀疏自编码器(SAE)。我们发现,针对“假装你是一个不诚实的模型:...”数据集训练的探针在跨分布情境下能非常好地概括,甚至在仅对欺骗陈述进行评估时(无需思考链)就能 consistently 获得 AUROC 超过 95%。我们还发现两个 SAE 特征在欺骗检测方面表现良好,但无法引导模型少说谎。我们希望我们的开源沙盒、游戏日志和探针能帮助anticipate and mitigate 语言-based 智能体中的欺骗行为与能力。

关键词

引用

@article{arxiv.2504.04072,
  title  = {Among Us: A Sandbox for Measuring and Detecting Agentic Deception},
  author = {Satvik Golechha and Adrià Garriga-Alonso},
  journal= {arXiv preprint arXiv:2504.04072},
  year   = {2026}
}

备注

21 pages, preprint