中文

大型语言模型是否展现出自发的理性欺骗行为?

计算与语言 2025-04-02 v1

摘要

大型语言模型(LLM)在被鼓励时能够有效地欺骗,但在何种条件下会自发欺骗?表现出在推理任务中更好表现的模型是否也更擅长自发欺骗,在被认为理性的情境下会自发欺骗吗?本研究采用预先登记的实验方案,运用信号理论工具,评估大型语言模型在自发欺骗方面的表现。评估了多种专有闭源和开源 LLM,采用修改的2x2博弈(仿照囚徒困境)方案,其中包含一个自由使用无限制语言与另一代理人交流的阶段。该方案创造了欺骗的机会,条件变化影响欺骗对代理人理性自我利益的有用性。结果表明:1)所有测试中的 LLM 在至少某些条件下都会自发误报其行动;2)它们通常更倾向于在欺骗有利于他们的情境中自发欺骗;3)整体推理能力更强的模型倾向于以更高的比例欺骗。综上,这些结果表明 LLM 的推理能力与诚实性之间存在权衡。它们也从一种新型实验配置中提供了类似推理行为的 LLM 证据。最后,揭示了影响 LLM 欺骗或不欺骗的特定情境因素。我们讨论了当前及其推理能力继续提高时,对由 LLM 驱动的自主面向人类的系统的影响。

关键词

引用

@article{arxiv.2504.00285,
  title  = {Do Large Language Models Exhibit Spontaneous Rational Deception?},
  author = {Samuel M. Taylor and Benjamin K. Bergen},
  journal= {arXiv preprint arXiv:2504.00285},
  year   = {2025}
}