深度强化学习在持续任务中的实证研究
人工智能
2025-01-14 v1
摘要
在强化学习(RL)中,持续任务指指示代理环境交互持续进行且无法拆分为情节的任务。当环境重置不可用、由代理控制或预定义,但所有奖励——包括重置后的奖励——都至关重要时,这类任务尤为适用。这类情境频繁出现于实际应用,无法由情景任务建模。尽管现代深度RL算法在情景任务中已广泛研究并得到良好理解,但其在持续任务中的行为仍鲜有探讨。为填补这一空白,本文基于基于 Mujoco 和 Atari 环境构建的持续任务测试平台,对几类著名深度RL算法进行实证研究,揭示了持续任务的若干关键见解。通过这些测试平台,我们还研究了Naik 等人(2024)提出的一种改进基于时序差分(TD)的RL算法的有效方法——以奖励中心化。虽然该方法的原始工作主要聚焦于结合Q学习,但我们的实验结果扩展了其发现,表明该方法在更广泛的算法范围内同样有效,能扩展至更大规模的任务,并超越两种其他奖励中心化方法。
引用
@article{arxiv.2501.06937,
title = {An Empirical Study of Deep Reinforcement Learning in Continuing Tasks},
author = {Yi Wan and Dmytro Korenkevych and Zheqing Zhu},
journal= {arXiv preprint arXiv:2501.06937},
year = {2025}
}