中文

Avalon的思想博弈:通过递归沉思对抗欺骗

人工智能 2023-10-25 v3 计算与语言 计算机与社会 机器学习 多智能体系统

摘要

大语言模型(LLMs)近期的突破在 LLM-as-Agent 领域取得了显著成功。然而,一个普遍的假设是 LLM 处理的信息始终诚实,忽视了人类社会和 AI 生成内容中普遍存在的欺骗性或误导性信息。这一疏忽使 LLM 易受恶意操控,可能导致有害后果。本研究利用复杂的 Avalon 游戏作为测试平台,探索 LLM 在欺骗环境中的潜力。Avalon 充满错误信息且需要复杂逻辑,表现为一种“思想博弈”。受人类在 Avalon 游戏中递归思考与视角采择有效性的启发,我们引入了一种新颖框架——递归沉思(ReCon),以增强 LLM 识别并抵御欺骗信息的能力。ReCon 结合了表述与精炼沉思过程;表述沉思产生初始想法与发言,而精炼沉思进一步润色它们。此外,我们分别将一阶与二阶视角转换纳入这些过程。具体而言,一阶允许 LLM 智能体推断他人的心理状态,二阶涉及理解他人如何感知该智能体的心理状态。将 ReCon 与不同 LLM 集成后,Avalon 游戏的大量实验结果表明其能在无需额外微调与数据的情况下协助 LLM 辨别并规避欺骗信息。最后,我们对 ReCon 的有效性给出了一种可能的解释,并探讨了 LLM 当前在安全性、推理、说话风格与格式方面的局限,可能为后续研究提供见解。

关键词

引用

@article{arxiv.2310.01320,
  title  = {Avalon's Game of Thoughts: Battle Against Deception through Recursive Contemplation},
  author = {Shenzhi Wang and Chang Liu and Zilong Zheng and Siyuan Qi and Shuo Chen and Qisen Yang and Andrew Zhao and Chaofei Wang and Shiji Song and Gao Huang},
  journal= {arXiv preprint arXiv:2310.01320},
  year   = {2023}
}

备注

40 pages