中间奖励对目标达成策略学习的计算增益
人工智能
2022-03-15 v5
摘要
许多目标达成强化学习(RL)任务已通过经验验证,对子目标给予智能体奖励可提升收敛速度与实际性能。我们试图提供一个理论框架,以同步值迭代次数来量化完成子目标给予奖励的计算增益。具体而言,我们将子目标视为单向的{\em 中间状态},其每回合仅能被访问一次,并提出考虑这些单向中间状态的两种设定:单向单路径(OWSP)与单向多路径(OWMP)设定。在 OWSP 与 OWMP 两种设定中,我们均证明向子目标添加{\em 中间奖励}比仅在智能体完成抵达终止状态的目标时给予一次奖励更具计算效率。我们还揭示了 OWMP 设定中计算复杂度与最短路径追求之间的权衡:添加中间奖励显著降低了抵达目标的计算复杂度,但智能体可能找不到最短路径;而使用稀疏终止奖励时,智能体以显著更高的计算代价找到最短路径。我们还在 MiniGrid 环境上使用 Q-learning 与若干流行深度 RL 算法进行了大量实验,佐证了理论结果。
引用
@article{arxiv.2107.03961,
title = {Computational Benefits of Intermediate Rewards for Goal-Reaching Policy Learning},
author = {Yuexiang Zhai and Christina Baek and Zhengyuan Zhou and Jiantao Jiao and Yi Ma},
journal= {arXiv preprint arXiv:2107.03961},
year = {2022}
}