中文

DeceptionBench:用于评估 AI 在真实情景中欺骗行为的全面基准

计算与语言 2025-11-18 v2 人工智能 机器学习

摘要

尽管大型语言模型(LLM)在多样认知任务中取得了显著进展,但这些能力的快速提升也引入了潜在的欺骒行为,可能在高风险部署中引发严重问题。更关键的是,针对真实情景中欺骒行为的表征仍未得到充分探索。为弥合这一差距,我们构建了 DeceptionBench——第一个系统评估欺骒倾向在不同社会领域中如何表现、其内在行为模式为何以及外在因素如何影响的基准测试。具体而言,在静态计数方面,基准包含 150 个精心设计的情景,涵盖经济、医疗、教育、社交互动和娱乐五大领域,超过 1000 份样本,为欺骒分析提供了充足的实证基础。在内在维度上,我们探讨模型是否表现出自利的egoistic倾向或讨好型sycophantic行为。而在外在维度上,我们检验情境因素如何在中性条件、奖励激励和强制压力下调制欺骒输出。此外,我们纳入持续的多回合互动循环,以构建更贴近真实世界反馈动态的模拟。广泛的实验涵盖 LLMs 和大型推理模型(LRMs),揭示了关键脆弱性,特别是强化动态下欺骒行为的放大,表明当前模型缺乏对各种欺骒行为的稳健抵抗力,亟需针对各种欺骒行为开发更先进的安全措施。代码和资源已公开于 https://github.com/Aries-iai/DeceptionBench。

关键词

引用

@article{arxiv.2510.15501,
  title  = {DeceptionBench: A Comprehensive Benchmark for AI Deception Behaviors in Real-world Scenarios},
  author = {Yao Huang and Yitong Sun and Yichi Zhang and Ruochen Zhang and Yinpeng Dong and Xingxing Wei},
  journal= {arXiv preprint arXiv:2510.15501},
  year   = {2025}
}

备注

28 pages, 17 figures, accepted by NeruIPS 2025