中文

DVM:面向社交推理游戏中可控 LLM 智能体的探索

人工智能 2025-01-14 v1

摘要

大型语言模型提升了社交推理游戏中游戏智能体的能力。这些游戏严重依赖对话驱动的交互,并要求智能体基于此类信息进行推断、决策和表达。虽然这一进展使得 SDG 中的非玩家角色更加复杂和具有策略性,但仍然存在控制这些智能体熟练度的需求。这种控制不仅确保 NPC 能够适应游戏过程中不同的难度级别,还能为 LLM 智能体的安全性和公平性提供洞察。在本文中,我们提出了 DVM,一种用于开发面向 SDG 的可控 LLM 智能体的新框架,并在最受欢迎的 SDG 之一《狼人杀》上展示了其实现。DVM 包含三个主要组件:预测器、决策器和讨论器。通过将强化学习与胜率约束的决策链奖励机制相结合,我们使智能体能够动态调整其游戏熟练度以达到指定的胜率。实验表明,DVM 不仅在《狼人杀》游戏中优于现有方法,还成功调节其性能水平以满足预定义的胜率目标。这些结果为 LLM 智能体在 SDG 中的自适应和平衡游戏铺平了道路,为可控游戏智能体的研究开辟了新途径。

关键词

引用

@article{arxiv.2501.06695,
  title  = {DVM: Towards Controllable LLM Agents in Social Deduction Games},
  author = {Zheng Zhang and Yihuai Lan and Yangsen Chen and Lei Wang and Xiang Wang and Hao Wang},
  journal= {arXiv preprint arXiv:2501.06695},
  year   = {2025}
}

备注

Accepted by ICASSP 2025