中文

OptionZero:基于学习选项的规划

人工智能 2025-03-24 v3 机器学习

摘要

使用选项——一系列基本动作——进行规划已被证明在复杂环境中的强化学习中是有效的。先前研究侧重于使用预定义选项或通过专家演示数据学习选项。受到 MuZero 的启发,该方法无需任何人类知识即可学习超人类启发式策略,我们提出了一种名为 OptionZero 的新方法。OptionZero 将一个选项网络融入 MuZero,通过自我对弈游戏自主发现选项。此外,我们修改了动力学网络以在使用选项时提供环境转换,从而在相同的模拟约束下进行更深入的搜索。在 26 个 Atari 游戏上进行的实证实验表明,OptionZero 优于 MuZero,在平均人类归一化分数上实现了 131.58% 的提升。我们的行为分析表明,OptionZero 不仅学习选项,还习得针对不同游戏特性的策略技能。我们的发现为在规划中发现和使用选项展示了有前景的方向。我们的代码可在 https://rlg.iis.sinica.edu.tw/papers/optionzero 获取。

关键词

引用

@article{arxiv.2502.16634,
  title  = {OptionZero: Planning with Learned Options},
  author = {Po-Wei Huang and Pei-Chiun Peng and Hung Guei and Ti-Rong Wu},
  journal= {arXiv preprint arXiv:2502.16634},
  year   = {2025}
}

备注

Accepted by the Thirteenth International Conference on Learning Representations (ICLR 2025) as oral presentation