中文

面向大语言模型顺序决策能力的UNO评估竞技场

计算与语言 2024-06-25 v1

摘要

顺序决策指的是考虑环境动态变化的算法,其中早期决策会影响后续决策。随着大语言模型(LLM)在任务之间展示出强大的能力,我们不禁问自己:当前的LLM是否能够有效地做出顺序决策?为回答此问题,我们提出了基于UNO卡牌游戏的UNO竞技场,用于评估大语言模型的顺序决策能力,并详细解释为何选择UNO。在UNO竞技场中,我们基于蒙特卡洛方法的新指标动态评估大语言模型的顺序决策能力。我们设置了随机玩家、基于深度Q网络(DQN)的强化学习玩家和大语言模型玩家(如GPT-4、Gemini-pro)进行比较测试。此外,为提高大语言模型的顺序决策能力,我们提出了TUTRI玩家,该玩家能够让大语言模型在游戏历史概述和游戏策略的反思下进行自我行动。大量实验表明,TUTRI玩家在Vanilla大语言模型玩家的顺序决策性能上实现了显著的突破。

关键词

引用

@article{arxiv.2406.16382,
  title  = {UNO Arena for Evaluating Sequential Decision-Making Capability of Large Language Models},
  author = {Zhanyue Qin and Haochuan Wang and Deyuan Liu and Ziyang Song and Cunhang Fan and Zhao Lv and Jinlin Wu and Zhen Lei and Zhiying Tu and Dianhui Chu and Xiaoyan Yu and Dianbo Sui},
  journal= {arXiv preprint arXiv:2406.16382},
  year   = {2024}
}