视野缩减使强化学习可扩展
机器学习
2025-10-23 v3 人工智能
摘要
在本文中,我们研究离线强化学习(RL)算法的可扩展性。原则上,一个真正可扩展的离线 RL 算法应该能够在给定足够的数据、计算和模型容量的情况下解决任何给定的问题,无论其复杂度如何。我们调查了当前现有的离线 RL 算法在多样化、具有挑战性的、先前未解决的任务上是否以及如何匹配这一承诺,使用了比典型离线 RL 数据集大 1000 倍的数据集。我们观察到,尽管增加了数据量,许多现有的离线 RL 算法表现出较差的扩展行为,在远低于最大性能处趋于饱和。我们假设视野(horizon)是导致离线 RL 扩展性差的主要原因。我们通过多个分析实验经验性地验证了这一假设,表明长视野确实对扩展离线 RL 构成了根本性障碍。然后我们证明各种视野缩减技术显著提升了在具有挑战性任务上的可扩展性。基于我们的见解,我们还引入了一种极简但可扩展的方法 SHARSA,有效地缩减了视野。SHARSA 在我们的评估方法中取得了最佳的渐近性能和扩展行为,表明显式缩减视野释放了离线 RL 的可扩展性。
引用
@article{arxiv.2506.04168,
title = {Horizon Reduction Makes RL Scalable},
author = {Seohong Park and Kevin Frans and Deepinder Mann and Benjamin Eysenbach and Aviral Kumar and Sergey Levine},
journal= {arXiv preprint arXiv:2506.04168},
year = {2025}
}
备注
NeurIPS 2025