大语言模型能玩好文字游戏吗?当前最优水平与开放问题
计算与语言
2025-04-01 v2 人工智能
机器学习
摘要
诸如 ChatGPT 与 GPT-4 之类的大语言模型(LLM)近期展现了其与人类用户交流的卓越能力。在本技术报告中,我们率先考察它们玩文字游戏的能力,在此类游戏中玩家须理解环境并通过与游戏世界对话来应对情境。我们的实验表明,ChatGPT 相较于所有已有系统具竞争力,但仍表现出较低水平的智能。确切地说,ChatGPT 无法通过玩游戏甚至阅读游戏手册来构建世界模型;它可能未能利用自身已有的世界知识;它无法随游戏推进推断每一步的目标。我们的结果在人工智能、机器学习与自然语言处理的交叉领域开启了新的研究问题。
引用
@article{arxiv.2304.02868,
title = {Can Large Language Models Play Text Games Well? Current State-of-the-Art and Open Questions},
author = {Chen Feng Tsai and Xiaochen Zhou and Sierra S. Liu and Jing Li and Mo Yu and Hongyuan Mei},
journal= {arXiv preprint arXiv:2304.02868},
year = {2025}
}