用于处理复杂任务的强化学习、动作模型学习与数值规划集成
人工智能
2025-02-19 v1
摘要
自动化规划算法需要一个指定每个动作 preconditions 和 effects 的模型。获得这样的域模型极其困难。虽然存在学习域模型的算法,但仍不清楚在数值规划环境中(即包含离散和数值状态变量的环境)学习域模型和规划是否是有效的方法。在本工作中,我们探讨了学习数值域模型的好处,并将其与替代的无模型解决方案进行比较。作为案例研究,我们使用 Minecraft(一个流行的沙盒游戏,已被用作 AI 挑战)中的两个任务。首先,我们考虑离线学习 setting,即可以使用用来学习的专家轨迹集合。这就是学习域模型的标准 setting。我们使用数值安全动作模型学习(NSAM)算法学习数值域模型,并使用所学域模型和数值规划器来解决新问题。我们将这种基于模型的解决方案称为 NSAM_(+p),并将其与几个无模版 Imitation Learning(IL)和离线强化学习(RL)算法进行比较。实证结果表明,一些 IL algorithm 可以更快地学习以解决简单任务,而 NSAM_(+p) 允许解决需要长期规划的任务,并能够泛化到更大环境中的问题。然后,我们考虑在线学习 setting,即通过在环境中移动代理来完成学习。对于这种 setting,我们引入了 RAMP。在 RAMP 中,代理执行期间收集的观察值用于同时训练 RL 策略和学习规划域动作模型。这在 RL 策略和所学域模型之间形成正向反馈回路。我们通过实验演示了使用 RAMP 的好处,表明它比多个 RL baseline 更高效地寻找计划并解决更多问题。
引用
@article{arxiv.2502.13006,
title = {Integrating Reinforcement Learning, Action Model Learning, and Numeric Planning for Tackling Complex Tasks},
author = {Yarin Benyamin and Argaman Mordoch and Shahaf S. Shperberg and Roni Stern},
journal= {arXiv preprint arXiv:2502.13006},
year = {2025}
}