直接预测信念用于带延迟的强化学习
机器学习
2025-06-10 v2
摘要
带延迟的强化学习(RL)具有挑战性,因为感官感知滞后于实际事件:RL 智能体需要基于过去的观测来估计其环境的真实状态。最先进(SOTA)的方法通常采用递归的、逐步的状态预测。这可能导致复合误差的累积。为了解决这个问题,我们提出了一种名为直接预测信念 Transformer(DFBT)的新型信念估计方法,它直接从观测预测状态,而无需逐步增量估计中间状态。我们从理论上证明,DFBT 大大减少了现有递归预测方法的复合误差,从而产生更强的性能保证。在 D4RL 离线数据集的实验中,DFBT 减少了复合误差,并具有显著的预测精度。DFBT 预测状态序列的能力还促进了多步自举,从而大大提高了学习效率。在 MuJoCo 基准上,我们基于 DFBT 的方法大大优于 SOTA 基线。代码可在 https://github.com/QingyuanWuNothing/DFBT 获取。
引用
@article{arxiv.2505.00546,
title = {Directly Forecasting Belief for Reinforcement Learning with Delays},
author = {Qingyuan Wu and Yuhui Wang and Simon Sinong Zhan and Yixuan Wang and Chung-Wei Lin and Chen Lv and Qi Zhu and Jürgen Schmidhuber and Chao Huang},
journal= {arXiv preprint arXiv:2505.00546},
year = {2025}
}