中文

分层行为空间

人工智能 2026-04-28 v1 机器学习

摘要

分层强化学习的近期工作表明,在一组预定义的选项奖励函数上进行学习时,可成功扩展至数十亿个时间步。我们证明,无需对每个选项使用单一奖励函数,而是可以通过让控制器指定奖励函数的线性组合,有效地利用奖励函数诱导出一个行为空间,从而表示更具表达性的策略集合。我们将此方法称为分层行为空间(HBS)。我们在 NetHack Learning Environment 上对 HBS 进行评估,展示了出色的性能。我们进行了一系列实验并确定,与常规认知可能相反,我们方法中分层带来的益处源于增强的探索而非长期推理。

关键词

引用

@article{arxiv.2604.24558,
  title  = {Hierarchical Behaviour Spaces},
  author = {Michael Tryfan Matthews and Anssi Kanervisto and Jakob Foerster and Pierluca D'Oro and Scott Fujimoto and Mikael Henaff},
  journal= {arXiv preprint arXiv:2604.24558},
  year   = {2026}
}