中文

控制的二分法:分离可控与不可控之物

机器学习 2022-10-25 v1

摘要

未来或回报条件监督学习是一种新兴的离线强化学习(RL)范式,其中与观测动作序列相关的未来结果(即回报)被用作训练以模仿相同动作的策略的输入。尽管回报条件化是诸如决策Transformer(DT)等流行算法的核心,这些方法往往在高度随机的环境中表现不佳,其中偶发的高回报可能源于环境随机性而非动作本身。此类情形会导致所学策略与其条件输入不一致;即,在环境中使用策略行动时,若以特定期望回报为条件,产生的真实回报分布与期望大相径庭。本工作中,我们提出控制二分法(DoC),一种未来条件监督学习框架,将策略可控的机制(动作)与策略不可控的机制(环境随机性)分离。我们通过使策略以未来的潜变量表征为条件,并设计互信息约束以移除潜变量中与环境随机性相关的任何信息,实现这一分离。理论上,我们证明DoC产生与其条件输入一致的策略,确保以期望高回报未来结果为条件化所学策略将正确诱导高回报行为。实证上,我们表明DoC在具有高度随机回报与转移的环境中能够取得显著优于DT的性能。

关键词

引用

@article{arxiv.2210.13435,
  title  = {Dichotomy of Control: Separating What You Can Control from What You Cannot},
  author = {Mengjiao Yang and Dale Schuurmans and Pieter Abbeel and Ofir Nachum},
  journal= {arXiv preprint arXiv:2210.13435},
  year   = {2022}
}