大语言模型间战略交互中的欺骗能力
计算与语言
2026-04-28 v2 人工智能
多智能体系统
摘要
随着大语言模型(LLM)智能体在各种情境中被自主部署,评估其战略欺骗能力变得至关重要。虽然近期研究考察了AI系统如何对人类开发者进行欺骗,但LLM之间的欺骗仍待深入探索。我们通过两个博弈论框架——廉价谈话信号博弈和同行评估对抗博弈——研究了前沿LLM智能体的欺骗能力和倾向。测试了四个模型(GPT-4o、Gemini-2.5-pro、Claude-3.7-Sonnet和Llama-3.3-70b),我们测量了在有和没有显式提示的情况下的欺骗表现,同时通过思维链推理分析了欺骗策略。在提示下,大多数模型,尤其是Gemini-2.5-pro和Claude-3.7-Sonnet,实现了近乎完美的表现。关键的是,模型在没有提示的情况下表现出显著的欺骗倾向:所有模型在同行评估中都选择欺骗而非坦白(100%的比率),而在廉价谈话中选择欺骗的模型成功率达到95-100%。这些发现强调了在多智能体环境中使用高风险博弈论场景进行稳健评估的必要性。
引用
@article{arxiv.2510.12826,
title = {Scheming Ability in LLM-to-LLM Strategic Interactions},
author = {Thao Pham},
journal= {arXiv preprint arXiv:2510.12826},
year = {2026}
}
备注
20 pages, 13 figures