中文

ULTHO:深度强化学习中超轻量且高效的超参数优化

机器学习 2025-08-04 v2 人工智能

摘要

超参数优化(HPO)是机器学习中的一个价值数十亿美元的问题,对训练效率和模型性能有显著影响。然而,由于深度强化学习(RL)的高非平稳性和计算成本,在其中实现高效且稳健的HPO始终具有挑战性。为了解决这个问题,现有方法尝试将常见的HPO技术(例如,基于种群的训练或贝叶斯优化)适应到RL场景中。然而,它们仍然样本效率低下且计算昂贵,无法促进广泛的应用。在本文中,我们提出了ULTHO,这是一个用于在深度RL单次运行中快速进行HPO的超轻量但强大的框架。具体而言,我们将HPO过程表述为具有聚类臂的多臂老虎机(MABC),并将其直接与长期回报优化联系起来。ULTHO还提供了一个量化和统计的视角来高效过滤超参数。我们在包括ALE、Procgen、MiniGrid和PyBullet的基准上测试了ULTHO。大量实验表明,ULTHO能够以简单的架构实现卓越的性能,有助于推动先进和自动化RL系统的发展。

关键词

引用

@article{arxiv.2503.06101,
  title  = {ULTHO: Ultra-Lightweight yet Efficient Hyperparameter Optimization in Deep Reinforcement Learning},
  author = {Mingqi Yuan and Bo Li and Xin Jin and Wenjun Zeng},
  journal= {arXiv preprint arXiv:2503.06101},
  year   = {2025}
}

备注

24 pages, 25 figures