强化学习中的自举表示
机器学习
2023-06-21 v1 人工智能
机器学习
摘要
在强化学习(RL)中,状态表示是处理大型或连续状态空间的关键。虽然深度学习算法的一个承诺是自动构建为其试图解决的任务良好调谐的特征,但这样的表示可能并不会从深度 RL 智能体的端到端训练中浮现。为缓解此问题,辅助目标常被纳入学习过程,并有助于塑造所学状态表示。自举方法是当今实现这些额外预测的首选方法。然而,尚不清楚这些算法捕获了哪些特征,以及它们与其他基于辅助任务的方法所得特征有何关联。在本文中,我们填补这一空白,并对时序差分学习(Sutton, 1988)所学状态表示给出理论刻画。令人惊讶的是,我们发现,在策略评估设定下,对于环境的大多数转移结构,该表示不同于蒙特卡洛与残差梯度算法所学特征。我们描述了这些表示在策略评估中的有效性,并利用我们的理论分析设计新的辅助学习规则。我们以经验比较这些学习规则在不同累积函数下于经典领域(如四房间领域(Sutton et al, 1999)和山地车(Moore, 1990))上的表现,作为理论结果的补充。
引用
@article{arxiv.2306.10171,
title = {Bootstrapped Representations in Reinforcement Learning},
author = {Charline Le Lan and Stephen Tu and Mark Rowland and Anna Harutyunyan and Rishabh Agarwal and Marc G. Bellemare and Will Dabney},
journal= {arXiv preprint arXiv:2306.10171},
year = {2023}
}
备注
ICML 2023