中文

深度强化学习中时序信用分配综述

机器学习 2024-07-08 v2 人工智能

摘要

信用分配问题 (CAP) 是指强化学习 (RL) 智能体将动作与其长期后果相关联的长期挑战。解决CAP是将RL成功部署到现实世界的关键步骤,因为大多数决策问题提供的反馈是嘈杂的、延迟的,并且很少或没有关于原因的信息。这些条件使得很难将偶然的结果与基于知情决策的结果区分开来。然而,信用的数学本质和CAP仍然缺乏充分的理解和定义。在这篇综述中,我们回顾了深度RL中时序信用分配 (CA) 的最新进展。我们提出了一个统一的信用形式化体系,能够对最先进的算法进行公平比较,并增进我们对各种方法之间权衡的理解。我们将CAP表述为从有限经验中学习动作对结果影响的问题。我们讨论了由延迟效应、置换和缺乏动作影响所带来的挑战,并分析了现有方法如何旨在解决这些问题。最后,我们调查了评估信用分配方法的协议,并提出了诊断不同方法困难来源的方法。总体而言,本综述为新入行的从业者与研究人员提供了该领域的概述,为希望加快CAP新研究启动阶段的学者提供了一致的视角,并指出了未来研究的潜在方向。

关键词

引用

@article{arxiv.2312.01072,
  title  = {A Survey of Temporal Credit Assignment in Deep Reinforcement Learning},
  author = {Eduardo Pignatelli and Johan Ferret and Matthieu Geist and Thomas Mesnard and Hado van Hasselt and Olivier Pietquin and Laura Toni},
  journal= {arXiv preprint arXiv:2312.01072},
  year   = {2024}
}

备注

56 pages, 2 figures, 4 tables