因果性与批量强化学习:未知领域规划的互补方法
机器学习
2020-06-05 v1 人工智能
摘要
强化学习算法在在线学习环境中取得了巨大成功。然而,这些成功依赖于算法智能体与其环境之间的低代价交互。在许多强化学习可发挥作用的环境中,如医疗和自动驾驶,大多数在线强化学习算法在训练初期所犯的错误伴随着不可接受的成本。这些环境要求开发能够在所谓批量设置下运行的强化学习算法,其中算法必须从固定、有限且由某个(可能未知的)策略生成的数据集中学习。评估不同于收集数据所用策略的策略称为离屏策略评估 (off-policy evaluation),自然提出了反事实问题。在本项目中,我们展示了离屏策略评估与因果推断中的处理效应估计是解决同一问题的两种途径,并比较了这两个领域近期的进展。
引用
@article{arxiv.2006.02579,
title = {Causality and Batch Reinforcement Learning: Complementary Approaches To Planning In Unknown Domains},
author = {James Bannon and Brad Windsor and Wenbo Song and Tao Li},
journal= {arXiv preprint arXiv:2006.02579},
year = {2020}
}