中文

价值型深度强化学习中超参数选择的一致性

机器学习 2024-12-02 v3 人工智能

摘要

深度强化学习(deep RL)通过算法设计与严谨的超参数选择相结合,在各个领域取得了巨大成功。算法改进往往是基于先前方法所构建的迭代性提升,而超参数选择则通常继承自先前方法或为所提出的技术专门微调。尽管超参数选择对性能具有关键影响,但仍常常被算法进步所掩盖。本文对价值型深度强化学习代理的超参数选择可靠性进行了广泛的实证研究,包括引入一种新的评分来量化各种超参数的一致性和可靠性。我们的发现不仅有助于确定哪些超参数最需要微调,也有助于澄清哪些微调在不同训练方案下保持一致。

关键词

引用

@article{arxiv.2406.17523,
  title  = {On the consistency of hyper-parameter selection in value-based deep reinforcement learning},
  author = {Johan Obando-Ceron and João G. M. Araújo and Aaron Courville and Pablo Samuel Castro},
  journal= {arXiv preprint arXiv:2406.17523},
  year   = {2024}
}