分层行为空间
人工智能
2026-04-28 v1 机器学习
摘要
分层强化学习的近期工作表明,在一组预定义的选项奖励函数上进行学习时,可成功扩展至数十亿个时间步。我们证明,无需对每个选项使用单一奖励函数,而是可以通过让控制器指定奖励函数的线性组合,有效地利用奖励函数诱导出一个行为空间,从而表示更具表达性的策略集合。我们将此方法称为分层行为空间(HBS)。我们在 NetHack Learning Environment 上对 HBS 进行评估,展示了出色的性能。我们进行了一系列实验并确定,与常规认知可能相反,我们方法中分层带来的益处源于增强的探索而非长期推理。
引用
@article{arxiv.2604.24558,
title = {Hierarchical Behaviour Spaces},
author = {Michael Tryfan Matthews and Anssi Kanervisto and Jakob Foerster and Pierluca D'Oro and Scott Fujimoto and Mikael Henaff},
journal= {arXiv preprint arXiv:2604.24558},
year = {2026}
}