中文

一种面向具有分段稳定上下文的非平稳环境的自适应深度强化学习方法

机器学习 2022-12-27 v1

摘要

将强化学习(RL)部署到实际应用的关键挑战之一是适应未知环境上下文的变化,例如机器人任务中地形的改变和拥塞控制中带宽的波动。现有关于适应未知环境上下文的工作要么假设整个回合中上下文相同,要么假设上下文变量是马尔可夫的。然而,在许多实际应用中,环境上下文通常在一个随机时段内保持稳定,然后以突发且不可预测的方式在回合内发生改变,从而产生分段结构,现有工作未能解决该问题。为利用实际应用中分段稳定上下文的分段结构,本文提出一种分段上下文信念增强深度(SeCBAD)强化学习方法。我们的方法能够联合推断潜在上下文上的信念分布与分段长度上的后验,并利用当前上下文段内观测数据实现更精确的信念上下文推断。推断出的信念上下文可用于增强状态,从而得到能够适应上下文突发变化的策略。我们通过实验证明,SeCBAD 能够准确推断上下文分段长度,并在具有分段稳定上下文的玩具网格世界环境与 Mujuco 任务上优于现有方法。

关键词

引用

@article{arxiv.2212.12735,
  title  = {An Adaptive Deep RL Method for Non-Stationary Environments with Piecewise Stable Context},
  author = {Xiaoyu Chen and Xiangming Zhu and Yufeng Zheng and Pushi Zhang and Li Zhao and Wenxue Cheng and Peng Cheng and Yongqiang Xiong and Tao Qin and Jianyu Chen and Tie-Yan Liu},
  journal= {arXiv preprint arXiv:2212.12735},
  year   = {2022}
}

备注

NeurIPS 2022