中文

大语言模型能玩好文字游戏吗?当前最优水平与开放问题

计算与语言 2025-04-01 v2 人工智能 机器学习

摘要

诸如 ChatGPT 与 GPT-4 之类的大语言模型(LLM)近期展现了其与人类用户交流的卓越能力。在本技术报告中,我们率先考察它们玩文字游戏的能力,在此类游戏中玩家须理解环境并通过与游戏世界对话来应对情境。我们的实验表明,ChatGPT 相较于所有已有系统具竞争力,但仍表现出较低水平的智能。确切地说,ChatGPT 无法通过玩游戏甚至阅读游戏手册来构建世界模型;它可能未能利用自身已有的世界知识;它无法随游戏推进推断每一步的目标。我们的结果在人工智能、机器学习与自然语言处理的交叉领域开启了新的研究问题。

关键词

引用

@article{arxiv.2304.02868,
  title  = {Can Large Language Models Play Text Games Well? Current State-of-the-Art and Open Questions},
  author = {Chen Feng Tsai and Xiaochen Zhou and Sierra S. Liu and Jing Li and Mo Yu and Hongyuan Mei},
  journal= {arXiv preprint arXiv:2304.02868},
  year   = {2025}
}