中文

DynaMITE-RL:用于改进时间元强化学习的动态模型

机器学习 2024-12-05 v2

摘要

我们引入了DynaMITE-RL,一种元强化学习(meta-RL)方法,用于在潜在状态以不同速率演化的环境中进行近似推理。我们对情节会话(episode sessions)进行建模——即情节中潜在状态固定的部分——并提出了对现有元强化学习方法的三项关键修改:会话内潜在信息的一致性、会话掩码以及先验潜在条件。我们展示了这些修改在从离散的Gridworld环境到连续控制和模拟机器人辅助任务等各种领域中的重要性,证明DynaMITE-RL在样本效率和推理回报方面显著优于最先进的基线方法。

关键词

引用

@article{arxiv.2402.15957,
  title  = {DynaMITE-RL: A Dynamic Model for Improved Temporal Meta-Reinforcement Learning},
  author = {Anthony Liang and Guy Tennenholtz and Chih-wei Hsu and Yinlam Chow and Erdem Bıyık and Craig Boutilier},
  journal= {arXiv preprint arXiv:2402.15957},
  year   = {2024}
}