中文

深度强化学习中是否存在双下降现象

机器学习 2025-11-11 v1 人工智能 机器学习

摘要

双下降 (DD) 现象——即在插值点之后,过参数化模型的泛化性能得到改善——在深度强化学习 (DRL) 这一非平稳领域的探索仍寥寥无几。我们提供初步证据表明 DD 存在于模型无关 DRL 中,通过在不同模型容量下进行系统性研究,使用 Actor-Critic 框架。我们依赖基于信息论的度量——策略熵——来衡量训练期间的策略不确定性。初步结果显示清晰的 epoch 级 DD 曲线;策略进入第二下降区域与显著、持续的策略熵减少相关。这一熵减现象表明过参数化作用为隐式正则化,引导策略向损失景观中更平坦的极小值靠拢。这些发现确立了 DD 作为 DRL 的一个因素,并提供了基于信息的机制,用于设计更通用、可迁移且更鲁棒的智能体。

关键词

引用

@article{arxiv.2511.06895,
  title  = {On The Presence of Double-Descent in Deep Reinforcement Learning},
  author = {Viktor Veselý and Aleksandar Todorov and Matthia Sabatelli},
  journal= {arXiv preprint arXiv:2511.06895},
  year   = {2025}
}