玩转信任:通过理论心智学习双代理防御者以引导信念
摘要
随着大型语言模型 (LLM) 成为对话系统的引擎,其推理关于其对话伙伴意图和状态的能力(即形成并使用理论心智,或 ToM)对于与可能具有敌意倾向的伙伴进行安全交互日益重要。我们提出了一种新的以隐私为主题的 ToM 挑战——ToM for Steering Beliefs (ToM-SB),其中防御者必须作为双代理人行动,以引导具有部分先验知识的攻击者信念。在 ToM-SB 上成功,防御者必须与之互动并形成对攻击者的 ToM,目标是欺骗攻击者相信他们已成功提取敏感信息。我们发现,像 Gemini3-Pro 和 GPT-5.4 这类强大前沿模型在 ToM-SB 上常常失败,甚至在攻击者先验知识有限的困难情境中,尽管被提示推理关于攻击者信念 (ToM 提示),仍无法欺骗攻击者。为弥合这一差距,我们在 ToM-SB 上训练模型作为 AI 双代理人,使用强化学习,测试欺骗奖励与 ToM 奖励。值得注意的是,我们发现 ToM 与攻击者欺骗之间存在一种双向涌现关系:仅奖励欺骗成功会改善 ToM,而仅奖励 ToM 也会改善欺骗。我们在四个不同强度的攻击者、六种防御者方法以及分布内和分布外 (OOD) 评估中发现,ToM 与攻击者欺骗的提升高度相关,凸显信念建模是 ToM-SB 成功的关键驱动因素。结合 ToM 与欺骗奖励的 AI 双代理人在欺骗和 ToM 性能上均表现最佳,超越了在困难情境中使用 ToM 提示的 Gemini3-Pro 和 GPT-5.4。我们还展示了 ToM-SB 与 AI 双代理人可以扩展到更强大的攻击者, demonstrating 对 OOD 设置的泛化以及本任务的可升级性。
引用
@article{arxiv.2604.11666,
title = {Playing Along: Learning a Double-Agent Defender for Belief Steering via Theory of Mind},
author = {Hanqi Xiao and Vaidehi Patil and Zaid Khan and Hyunji Lee and Elias Stengel-Eskin and Mohit Bansal},
journal= {arXiv preprint arXiv:2604.11666},
year = {2026}
}
备注
First two authors contributed equally. Code: https://github.com/The-Inscrutable-X/AIDoubleAgentDefenders