中文

深度学习正则化在离线强化学习演员中的作用

流体动力学 2024-09-13 v1 数值分析 数值分析

摘要

深度学习正则化技术,如dropout、层归一化或权重衰减,在现代人工神经网络的构建中广泛应用,常导致更稳健的训练过程和 improved的泛化能力。然而,在强化学习(RL)领域,这些技术的应用仍有限,通常只用于价值函数估计器(Hiraoka等2021年; Smith等2022年),可能产生不利影响。在离线RL设置中,这一问题更为突出,这类设置与监督学习更相似,但受到的关注不足。最近的工作在连续离线RL(Park等2024年)中表明,虽然我们可以构建足够强大的批评网络,但演员网络的泛化仍然是瓶颈。本研究在经验上表明,将标准正则化技术应用于离线RL actor-critic算法中的演员网络,可在两个算法和三个不同的连续D4RL领域中平均提高6%。

关键词

引用

@article{arxiv.2409.07605,
  title  = {Dual scale Residual-Network for turbulent flow sub grid scale resolving: A prior analysis},
  author = {Omar Sallam and Mirjam Fürth},
  journal= {arXiv preprint arXiv:2409.07605},
  year   = {2024}
}