中文

Hoodwinked:面向语言模型的文本博弈中的欺骗与合作

计算与语言 2023-08-07 v2 计算机与社会 机器学习

摘要

当前语言模型是否具备欺骗与谎言识别能力?我们通过引入一个受 Mafia 和 Among Us 启发的文本博弈 Hoodwinked\textit{Hoodwinked} 来研究这一问题。玩家被锁在一所房子里,必须找到钥匙逃脱,但其中一名玩家受命杀害其他人。每次谋杀发生后,幸存玩家进行自然语言讨论,然后投票将一名玩家驱逐出游戏。我们使用由 GPT-3、GPT-3.5 和 GPT-4 控制的智能体进行实验,发现了欺骗与谎言识别能力的证据。杀手常否认罪行并指控他人,对投票结果产生可测量的影响。更先进的模型是更有效的杀手,在 24 次两两比较中有 18 次优于较小模型。辅助指标提供的证据表明,这一提升并非由不同动作中介,而是源于讨论中更强的说服技巧。为评估 AI 智能体欺骗人类的能力,我们在 https://hoodwinked.ai/ 公开了该游戏。

关键词

引用

@article{arxiv.2308.01404,
  title  = {Hoodwinked: Deception and Cooperation in a Text-Based Game for Language Models},
  author = {Aidan O'Gara},
  journal= {arXiv preprint arXiv:2308.01404},
  year   = {2023}
}

备注

Added reference for McKenzie 2023; updated acknowledgements