中文

利用前向-后向模型近似MDP同态

机器学习 2024-03-05 v3 人工智能

摘要

强化学习智能体必须通过试错费力地学习哪些状态-动作对具有价值等价性——这通常需要大量往往高得 prohibitive 的环境经验。已有提出的 MDP 同态将环境 MDP 约简为抽象 MDP,从而提升样本效率。因此,当能先验地构造出合适的同态时——通常借助实践者对环境对称性的知识——已取得令人印象深刻的改进。我们提出一种在离散动作空间中构造同态的新方法,其利用学习到的环境动态模型推断哪些状态-动作对导向同一状态——这可将状态-动作空间的大小缩减至最大为原始动作空间基数的因子。在 MinAtar 中,我们在低样本限制下,对所有游戏和优化器取平均,报告了相比基于价值的离策略基线近 4 倍的改进。

关键词

引用

@article{arxiv.2209.06356,
  title  = {Using Forwards-Backwards Models to Approximate MDP Homomorphisms},
  author = {Augustine N. Mavor-Parker and Matthew J. Sargent and Christian Pehle and Andrea Banino and Lewis D. Griffin and Caswell Barry},
  journal= {arXiv preprint arXiv:2209.06356},
  year   = {2024}
}

备注

Previously Presented at the Multi-disciplinary Conference on Reinforcement Learning and Decision Making (RLDM) 2022