中文

面向元强化学习的隐状态与隐任务解耦信念估计

人工智能 2021-05-17 v1 机器学习

摘要

设计元强化学习(meta-RL)算法引起了相当大的兴趣,其使自主智能体能够从少量经验中适应新任务。在元强化学习中,当前任务的设定(如奖励函数)对智能体是隐藏的。此外,由于传感器噪声或现实环境的限制,在每个任务内部状态也是隐藏的。因此,元强化学习智能体面临基于少量经验同时确定隐藏任务与状态的挑战。为此,我们提出估计关于任务与状态的解耦信念,利用任务与状态可视为各任务的全局与局部特征这一归纳偏置。具体而言,我们训练一个由深度神经网络参数化的层次状态空间模型(HSSM)作为环境模型,其全局与局部潜变量分别对应任务与状态。由于 HSSM 不允许后验分布(即信念)的解析计算,我们采用摊销推断来近似它。获得信念后,我们可以用该信念增强无模型策略的观测以高效训练策略。此外,由于任务与状态信息被分解且可解释,与未考虑层次性质的先前方法相比,下游策略训练得以简化。在 GridWorld 环境中的实证验证确认 HSSM 能够分离隐藏任务与状态信息。随后,我们在 MuJoCo 环境中将带 HSSM 的元强化学习智能体与先前元强化学习方法比较,确认我们的智能体需要更少的训练数据并达到更高的终末性能。

关键词

引用

@article{arxiv.2105.06660,
  title  = {Estimating Disentangled Belief about Hidden State and Hidden Task for Meta-RL},
  author = {Kei Akuzawa and Yusuke Iwasawa and Yutaka Matsuo},
  journal= {arXiv preprint arXiv:2105.06660},
  year   = {2021}
}

备注

accepted to L4DC2021