面向非平稳强化学习的因子化自适应
机器学习
2022-10-19 v2 人工智能
摘要
处理环境(例如转移动态)和目标(例如奖励函数)中的非平稳性是一个具有挑战性的问题,对强化学习(RL)的实际应用至关重要。虽然当前大多数方法将变化建模为单个共享嵌入向量,我们利用近期因果文献的见解,将非平稳性建模为独立的潜在变化因子,以及不同环境间的因果图。具体而言,我们提出非平稳 RL 的因子化自适应(FANS-RL),一种因子化自适应方法,联合学习因子化 MDP 形式的因果结构,以及各个时变变化因子的因子化表示。我们证明在标准假设下,可以完全恢复表示因子化转移和奖励函数的因果图,以及各个变化因子与状态分量之间的部分结构。通过我们的通用框架,可以考虑具有不同函数类型和变化频率的通用非平稳场景,包括跨片段和片段内的变化。实验结果表明,FANS-RL 在回报、潜在状态表示的紧凑性以及对不同程度非平稳性的鲁棒性方面优于现有方法。
引用
@article{arxiv.2203.16582,
title = {Factored Adaptation for Non-Stationary Reinforcement Learning},
author = {Fan Feng and Biwei Huang and Kun Zhang and Sara Magliacane},
journal= {arXiv preprint arXiv:2203.16582},
year = {2022}
}
备注
Accepted at the NeurIPS 2022