中文

Any-step Dynamics Model提高在线和离线强化学习中的未来预测

机器学习 2024-05-28 v1

摘要

基于模型的强化学习方法通过在动态模型中促进策略探索来提高数据效率,具有前景。然而,由于引导式预测问题,准确预测动态模型中的后续步骤仍然具有挑战性,该问题将下一个状态归因于对当前状态的预测。这导致模型滚动中的误差累积。本文提出Any-step Dynamics Model (ADM)以减少引导式预测,从而缓解累积误差。ADM允许在预测未来状态时使用可变长度的计划作为输入,而无需频繁进行引导式预测。我们设计了两个算法ADMPO-ON和ADMPO-OFF,分别将ADM应用于在线和离线模型方法。在线设置中,ADMPO-ON在样本效率方面优于以往最先进的方法。在离线设置中,ADMPO-OFF不仅在性能上优于最近提出的离线方法,而且还能仅使用单个ADM提供更好的模型不确定性定量。

关键词

引用

@article{arxiv.2405.17031,
  title  = {Any-step Dynamics Model Improves Future Predictions for Online and Offline Reinforcement Learning},
  author = {Haoxin Lin and Yu-Yan Xu and Yihao Sun and Zhilong Zhang and Yi-Chen Li and Chengxing Jia and Junyin Ye and Jiaji Zhang and Yang Yu},
  journal= {arXiv preprint arXiv:2405.17031},
  year   = {2024}
}