游戏中的思考:基于大语言模型的强化学习推理学习
人工智能
2025-09-01 v1
摘要
大语言模型在数学和编码等复杂推理任务中表现出色,但在儿童轻松完成的简单交互任务中常常力挫。此现象凸显了声明性知识(知道关于某事)与程序性知识(知道如何做某事)之间的关键鸿沟。虽然传统强化学习代理可通过环境交互获取程序性知识,但常作为黑箱且需要大量训练数据。在 contrast, LLMs拥有广泛的世界知识和推理能力,但无法有效将这种静态知识转化为交互环境中的动态决策。为此,我们提出游戏思考框架(TiG),赋予LLMs通过与游戏环境的直接交互来发展程序性理解,同时保留其内在的推理和解释能力。具体而言,TiG将基于环境反馈迭代细化的语言引导策略视为强化学习决策:LLMs生成语言引导的策略。我们的实验结果表明,TiG成功弥合了声明性与程序性知识之间的差距,在数据和计算需求大幅降低的情况下实现了与传统RL方法相当的性能。此外,TiG为其决策提供逐步的自然语言解释,大大提高了复杂交互任务的透明度和可解释性。
引用
@article{arxiv.2508.21365,
title = {Think in Games: Learning to Reason in Games via Reinforcement Learning with Large Language Models},
author = {Yi Liao and Yu Gu and Yuan Sui and Zining Zhu and Yifan Lu and Guohua Tang and Zhongqian Sun and Wei Yang},
journal= {arXiv preprint arXiv:2508.21365},
year = {2025}
}