强化学习中同时更新所有持续性值
机器学习
2022-11-22 v1
摘要
在强化学习中,学习智能体的性能对时间离散化的选择高度敏感。高频行动的智能体具有最佳控制机会,但也伴随一些缺陷,如可能的低效探索与动作优势消失。动作的重复,即动作持续性(action persistence),有所帮助,因为它允许智能体访问状态空间的更广阔区域并改善动作效应的估计。本工作中,我们推导出一种新颖的全持续性 Bellman 算子(All-Persistence Bellman Operator),其通过分解为子转移来有效利用低持续性经验,并借助引入合适的 bootstrap 程序利用高持续性经验。以此方式,我们采用任意时间尺度上收集的转移来同时更新所考虑持续性集合的动作值。我们证明了全持续性 Bellman 算子的收缩性质,并基于此扩展了经典 Q-learning 与 DQN。在提供关于持续性影响的研究后,我们在表格环境及更具挑战性的框架(包括部分 Atari 游戏)中实验评估了我们的方法。
引用
@article{arxiv.2211.11620,
title = {Simultaneously Updating All Persistence Values in Reinforcement Learning},
author = {Luca Sabbioni and Luca Al Daire and Lorenzo Bisi and Alberto Maria Metelli and Marcello Restelli},
journal= {arXiv preprint arXiv:2211.11620},
year = {2022}
}