动态更新-数据比:最小化世界模型过拟合
机器学习
2023-03-20 v1 机器学习
摘要
基于验证集性能的早期停止是在监督学习背景下寻找欠拟合与过拟合之间正确平衡的流行方法。然而,在强化学习中,即便是世界模型学习等监督式子问题,早期停止也不适用,因为数据集在持续演化。作为解决方案,我们提出一种通用的新方法,该方法基于在一小部分持续收集且未用于训练的经验上检测欠拟合与过拟合,在训练期间动态调整更新-数据(UTD)比。我们将该方法应用于最先进的基于模型的强化学习算法 DreamerV2,并在 DeepMind Control Suite 和 Atari k 基准上评估。结果表明,与 DreamerV2 中的默认设置相比,通过我们的方法调整 UTD 比能更好地平衡欠估计与过估计,并且与广泛的超参数搜索相比具有竞争力,而后者对许多应用并不可行。我们的方法消除了手动设置 UTD 超参数的需要,甚至对其他学习相关超参数具有更高的鲁棒性,进一步减少了必要的调参量。
引用
@article{arxiv.2303.10144,
title = {Dynamic Update-to-Data Ratio: Minimizing World Model Overfitting},
author = {Nicolai Dorka and Tim Welschehold and Wolfram Burgard},
journal= {arXiv preprint arXiv:2303.10144},
year = {2023}
}
备注
ICLR 2023