理解深度强化学习中线性区域的演化
机器学习
2022-11-10 v2 人工智能
摘要
深度强化学习所产生的策略通常以其学习曲线为特征,但在许多其他方面仍知之甚少。基于 ReLU 的策略会将输入空间划分为分段线性区域。我们试图利用涵盖一系列连续控制任务和策略网络维度的实证结果,来理解在深度强化学习过程中观察到的区域数量及其密度如何演化。直观上,我们可能预期在训练期间,区域密度会在策略频繁访问的区域中增加,从而实现细粒度控制。我们使用近期关于监督学习设置下神经网络所诱导的线性区域的理论与实证结果,作为我们结果的基准与比较。实证上,我们发现,沿最终策略产生的固定轨迹测量时,区域密度在整个训练过程中仅适度增加。然而,轨迹本身在训练期间也变长,因此从当前轨迹的视角来看,区域密度反而下降。我们的发现表明,深度强化学习策略的复杂性并非主要源于在策略轨迹及其附近观察到的函数复杂性的显著增长。
引用
@article{arxiv.2210.13611,
title = {Understanding the Evolution of Linear Regions in Deep Reinforcement Learning},
author = {Setareh Cohan and Nam Hee Kim and David Rolnick and Michiel van de Panne},
journal= {arXiv preprint arXiv:2210.13611},
year = {2022}
}
备注
NeurIPS 2022 camera ready