迈向因果感知的强化学习:状态依赖的动作精炼时序差分
机器学习
2022-11-01 v2 人工智能
摘要
尽管众所周知探索在强化学习(RL)中起着关键作用,但RL中连续控制任务的流行探索策略主要基于朴素的各向同性高斯噪声,而不考虑动作空间与任务之间的因果关系,并将动作的所有维度视为同等重要。在这项工作中,我们提出对原始动作空间进行干预,以发现动作空间与任务奖励之间的因果关系。我们提出了状态依赖动作精炼(SWAR)方法,解决了动作空间冗余问题并促进了RL中的因果发现。我们将RL任务中的因果发现表述为一个状态依赖的动作空间选择问题,并提出了两种实用算法作为解决方案。第一种方法TD-SWAR在时序差分学习过程中检测与任务相关的动作,而第二种方法Dyn-SWAR通过动态模型预测揭示重要动作。经验上,两种方法都为理解RL智能体所做的决策并在动作冗余任务中提高学习效率提供了途径。
引用
@article{arxiv.2201.00354,
title = {Toward Causal-Aware RL: State-Wise Action-Refined Temporal Difference},
author = {Hao Sun and Taiyi Wang},
journal= {arXiv preprint arXiv:2201.00354},
year = {2022}
}