LH-Deception:模拟与理解 LLM 在长期互动中的欺骗行为
计算与语言
2026-02-06 v3
摘要
欺骗是人类交流的普遍特征,也是大语言模型(LLM)中日益受关注的议题。虽然最近的研究记录了 LLM 欺骗的实例,但大多数评估局限于单轮提示,无法捕捉欺骗策略通常在其中继任务和动态情境压力下的展开。我们引入了一种新的模拟框架 LH-Deception,用于在扩展的相互依赖任务序列和动态情境压力下,对 LLM 欺骗进行系统、经验性的量化。LH-Deception 设计为一个多智能体系统:一个执行器智能体负责完成任务,一个监督者智能体负责评估进度、提供反馈并维持信任的动态状态。然后,一个独立的欺骗审计员审查完整的轨迹,以识别欺骗何时发生以及如何发生。我们在 11 个前沿模型上进行了广泛实验,包括封闭源和开源系统,发现欺骗具有模型依赖性,随事件压力而增加,并且始终侵蚀监督者的信任。定性分析进一步揭示了诸如“欺骗链”等在长期视角下出现的现象,这些现象在静态、单轮评估中难以察觉。我们的发现为在真实世界、信任敏感的情境中评估未来 LLM 提供了基础。
引用
@article{arxiv.2510.03999,
title = {LH-Deception: Simulating and Understanding LLM Deceptive Behaviors in Long-Horizon Interactions},
author = {Yang Xu and Xuanming Zhang and Samuel Yeh and Jwala Dhamala and Ousmane Dia and Rahul Gupta and Sharon Li},
journal= {arXiv preprint arXiv:2510.03999},
year = {2026}
}
备注
ICLR 2026