强化学习中奖励机与策略的联合推断
人工智能
2022-02-10 v2
摘要
引入高层知识是加速强化学习(RL)的有效途径,尤其对于具有稀疏奖励的复杂任务。我们研究一类 RL 问题,其中高层知识以奖励机的形式给出,即一种编码奖励函数的 Mealy 机。我们关注该知识事先对学习智能体不可用的设定。我们开发了一种迭代算法,执行奖励机与 RL 策略的联合推断(更具体地,q-learning)。在每次迭代中,算法维护一个假设奖励机与一组 RL 回合样本。它从当前假设奖励机导出 q 函数,并执行 RL 以更新 q 函数。在执行 RL 时,算法通过添加所获奖励与基于当前假设奖励机的奖励不一致的 RL 回合来更新样本。在下一迭代中,算法从更新后的样本推断新的假设奖励机。基于我们所定义的奖励机状态间等价关系,我们在连续迭代的假设奖励机间迁移 q 函数。我们证明,若可推断出极小奖励机且每回合 RL 的最大长度足够长,所提算法在极限下几乎必然收敛至最优策略。实验表明,以奖励机形式学习高层知识可令 RL 快速收敛至最优策略,而标准 RL 方法如 q-learning 与分层 RL 方法在许多任务中经大量训练步后未能收敛至最优策略。
引用
@article{arxiv.1909.05912,
title = {Joint Inference of Reward Machines and Policies for Reinforcement Learning},
author = {Zhe Xu and Ivan Gavran and Yousef Ahmad and Rupak Majumdar and Daniel Neider and Ufuk Topcu and Bo Wu},
journal= {arXiv preprint arXiv:1909.05912},
year = {2022}
}
备注
Fixed incorrect references in proof of Lemma 4