DynaMITE-RL:用于改进时间元强化学习的动态模型
机器学习
2024-12-05 v2
摘要
我们引入了DynaMITE-RL,一种元强化学习(meta-RL)方法,用于在潜在状态以不同速率演化的环境中进行近似推理。我们对情节会话(episode sessions)进行建模——即情节中潜在状态固定的部分——并提出了对现有元强化学习方法的三项关键修改:会话内潜在信息的一致性、会话掩码以及先验潜在条件。我们展示了这些修改在从离散的Gridworld环境到连续控制和模拟机器人辅助任务等各种领域中的重要性,证明DynaMITE-RL在样本效率和推理回报方面显著优于最先进的基线方法。
引用
@article{arxiv.2402.15957,
title = {DynaMITE-RL: A Dynamic Model for Improved Temporal Meta-Reinforcement Learning},
author = {Anthony Liang and Guy Tennenholtz and Chih-wei Hsu and Yinlam Chow and Erdem Bıyık and Craig Boutilier},
journal= {arXiv preprint arXiv:2402.15957},
year = {2024}
}