面向词典序强化学习的优先级软Q分解
人工智能
2024-05-03 v2
摘要
复杂任务的强化学习(RL)仍然是一项挑战,主要源于设计标量奖励函数的困难以及从零开始训练模型固有的低效性。相反,更好的方式是用基本子任务来刻画复杂任务,并尽可能复用子任务的解。在本工作中,我们处理由带优先级的子任务组成的连续空间词典序多目标RL问题,这类问题以难以求解而著称。我们证明这些问题可通过子任务变换进行标量化,随后利用值分解增量式求解。基于该洞见,我们提出优先级软Q分解(PSQD),一种用于在连续状态-动作空间中学习和调整词典序优先级下子任务解的新算法。PSQD能够在零样本组合中复用先前学到的子任务解,随后执行一个调整步骤。其利用保留的子任务训练数据进行离线学习的能力,消除了调整期间与环境进行新交互的需求。我们通过展示低维与高维仿真机器人控制任务以及离线学习的成功学习、复用与调整结果,证明了方法的有效性。与基线方法相比,PSQD不在冲突子任务或优先级约束之间做权衡,并在学习过程中满足子任务优先级。PSQD为处理复杂RL问题提供了一个直观框架,并揭示了子任务组合内在机制的洞见。
引用
@article{arxiv.2310.02360,
title = {Prioritized Soft Q-Decomposition for Lexicographic Reinforcement Learning},
author = {Finn Rietz and Erik Schaffernicht and Stefan Heinrich and Johannes Andreas Stork},
journal= {arXiv preprint arXiv:2310.02360},
year = {2024}
}
备注
Camera ready version