高吞吐环境中的可扩展选项学习
机器学习
2026-05-11 v3 人工智能
摘要
层次强化学习(RL)有望实现长时间尺度上的有效决策。虽然现有方法虽有前景,但尚未实现大规模训练的益处。本文我们识别并解决了将在高吞吐环境中扩展在线层次RL的若干关键挑战。我们提出了可扩展选项学习(SOL),一种高度可扩展的层次RL算法,实现约35倍的吞吐量提升。为证明SOL的性能与可扩展性,我们使用300亿帧经验在复杂游戏NetHack上训练层次智能体,显著超越平坦智能体并展示出正向规模化趋势。我们还在MiniHack和Mujoco环境中验证了SOL,展示了其通用性。我们的代码已开源于github.com/facebookresearch/sol。
引用
@article{arxiv.2509.00338,
title = {Scalable Option Learning in High-Throughput Environments},
author = {Mikael Henaff and Scott Fujimoto and Michael Matthews and Michael Rabbat},
journal= {arXiv preprint arXiv:2509.00338},
year = {2026}
}