合成双层规划的世界模型
人工智能
2025-07-15 v2
摘要
现代强化学习 (RL) 系统在复杂环境中(如视频游戏)展现出惊人的能力,但在学习新领域时仍不足以实现类人水平的样本效率和适应性。基于理论的强化学习 (TBRL) 是一种专为解决这一问题而设计的算法框架。 TBRL 借鉴认知理论,利用结构化的、因果的世界模型——“理论”——作为用于规划、泛化和探索的前向模拟器。尽管当前的 TBRL 系统为人类学习视频游戏提供了引人入胜的解释,但仍面临若干技术限制:其理论语言受限,规划算法不可扩展。为应对这些挑战,我们引入 TheoryCoder,这是一种 TBRL 的实例化方案,通过层次化表示理论和高效程序综合方法实现更强大的学习与规划能力。 TheoryCoder 赋予智能体通用抽象(例如“移动到”),随后通过学习低层次转移模型(由大型语言模型从观察中综合的 Python 程序)将其在特定环境中实现具体化。 双层规划算法可利用这种层次化结构来解决大规模问题。我们展示了该方法可成功应用于多样且具有挑战性的网格世界游戏,在此类环境中,基于直接综合策略的方法表现不佳。消融研究表明,使用层次化抽象的优势显而易见。
引用
@article{arxiv.2503.20124,
title = {Synthesizing world models for bilevel planning},
author = {Zergham Ahmed and Joshua B. Tenenbaum and Christopher J. Bates and Samuel J. Gershman},
journal= {arXiv preprint arXiv:2503.20124},
year = {2025}
}
备注
Accepted to TMLR