通过算法数据合成提升大语言模型在决策游戏中的能力
机器学习
2025-03-19 v1
摘要
大语言模型(LLM)在诸多领域展现出惊人的能力,但在复杂推理和决策任务方面常常感到困难。决策游戏本身就需要多层次的推理逻辑,因而构成了评估和提升 LLM 推理能力的理想实验室。在本工作中,我们首先探讨了 LLM 是否可以通过针对性的后训练掌握复杂决策游戏。为此,我们设计了数据合成策略,从两个经典游戏 Doudizhu 和 Go 中构建了大规模离线数据集。我们进一步开发了一套有效将该数据纳入 LLM 训练的技术, resulting in 两个新型智能体:Mastermind-Dou 和 Mastermind-Go。我们的实验结果表明,这些 Mastermind LLM 在各自所擅长的游戏中取得了具竞争力的表现。此外,我们探讨了将决策数据集成是否能提升 LLM 的通用推理能力。我们的发现表明,这种后训练在推理的某些方面具有积极影响,为优化 LLM 的数据收集和合成策略提供了宝贵的见解。
关键词
引用
@article{arxiv.2503.13980,
title = {Empowering LLMs in Decision Games through Algorithmic Data Synthesis},
author = {Haolin Wang and Xueyan Li and Yazhe Niu and Shuai Hu and Hongsheng Li},
journal= {arXiv preprint arXiv:2503.13980},
year = {2025}
}