中文

不知而学:连续迁移强化学习中的未观测上下文

机器学习 2021-06-08 v1 人工智能

摘要

在本文中,我们考虑连续状态与动作空间下、具有未观测上下文信息的迁移强化学习(RL)问题。例如,该上下文可表示专家智能体通过过去与世界的互动所形成的对世界的心智视图。我们假设此上下文对只能观测专家数据的学习智能体不可访问。那么,我们的目标是以上下文感知的专家数据,仅使用少量新数据样本,为学习器学习一个最优的上下文不可知策略。此类问题通常使用模仿学习解决,其假设专家与学习智能体可访问相同信息。然而,若学习器不知专家上下文,仅用专家数据将导致有偏的学习器策略,且需大量新数据样本以改进。为应对此挑战,本文将学习问题表述为一个因果边界约束的多臂老虎机(MAB)问题。该 MAB 的臂对应于一组基策略函数,它们可利用专家数据以无监督方式初始化,并表示受未观测上下文影响的不同专家行为。另一方面,MAB 约束对应于我们从专家数据计算的这些基策略函数累积奖励的因果边界。该 MAB 的解使学习智能体能够选择最佳基策略并在线改进之。而因果边界的使用降低了探索方差,从而提升了学习率。我们在一个自动驾驶实例上提供了数值实验,表明所提迁移 RL 方法相较于现有模仿学习方法能更快改进学习器策略,且在训练期间享有低得多的方差。

关键词

引用

@article{arxiv.2106.03833,
  title  = {Learning without Knowing: Unobserved Context in Continuous Transfer Reinforcement Learning},
  author = {Chenyu Liu and Yan Zhang and Yi Shen and Michael M. Zavlanos},
  journal= {arXiv preprint arXiv:2106.03833},
  year   = {2021}
}