单智能体游戏中模仿学习的缩放定律
机器学习
2024-12-20 v3 人工智能
机器学习
摘要
模仿学习(IL)是机器学习中应用最广泛的方法之一。然而,许多工作发现其往往无法完全恢复底层专家行为,即便在如单智能体游戏这类受限环境中也是如此。但这些工作均未深入探究扩大模型与数据规模的作用。受自然语言处理(NLP)中'扩大规模'已带来愈发强大的LLM的近期工作启发,我们探究在单智能体游戏的模仿学习设定中,谨慎扩大模型与数据规模能否带来类似改进。我们首先在多种Atari游戏上展示发现,之后聚焦于极具挑战性的NetHack游戏。在所有游戏中,我们发现IL损失与平均回报随计算预算(FLOPs)平滑缩放且强相关,从而形成训练计算最优IL智能体的幂律。最后,我们预测并训练了若干采用IL的NetHack智能体,发现其在所有设定下均以前期最优水平1.5倍的性能超越前者。我们的工作既展示了模仿学习在多种单智能体游戏中的缩放行为,也证明了扩大当前方法规模以获得NetHack中愈发强大的智能体的可行性,该游戏对当前AI系统而言仍极难攻克。
引用
@article{arxiv.2307.09423,
title = {Scaling Laws for Imitation Learning in Single-Agent Games},
author = {Jens Tuyls and Dhruv Madeka and Kari Torkkola and Dean Foster and Karthik Narasimhan and Sham Kakade},
journal= {arXiv preprint arXiv:2307.09423},
year = {2024}
}
备注
Accepted at TMLR 2024