中文

基于强化学习的语言智能体在狼人游戏中的策略博弈

人工智能 2025-05-30 v4 机器学习 多智能体系统

摘要

基于大语言模型(LLM)构建的智能体在广泛领域中已展现出巨大潜力。然而,在复杂决策任务中,纯基于 LLM 的智能体往往在其动作选择上表现出固有偏差,该偏差继承自模型的训练数据并导致次优性能。为开发策略语言智能体(即能生成灵活语言动作且具备强决策能力的智能体),我们提出一种新颖框架,以强化学习(RL)赋能基于 LLM 的智能体。我们考虑狼人游戏这一流行的社交推理游戏作为强调多变交流与策略玩法的具有挑战性的测试平台。为缓解语言动作中的固有偏差,我们的智能体使用 LLM 进行演绎推理并生成多样化的动作候选集。随后,一个经训练以优化决策能力的 RL 策略从候选中选择一个动作在游戏中进行。大量实验表明,我们的智能体克服了固有偏差,并在狼人游戏中优于现有的基于 LLM 的智能体。我们还进行了人-智能体实验,发现我们的智能体达到了人类水平的表现并展现出强大的策略玩法。

关键词

引用

@article{arxiv.2310.18940,
  title  = {Language Agents with Reinforcement Learning for Strategic Play in the Werewolf Game},
  author = {Zelai Xu and Chao Yu and Fei Fang and Yu Wang and Yi Wu},
  journal= {arXiv preprint arXiv:2310.18940},
  year   = {2025}
}

备注

Published in ICML 2024