关于模型基强化学习中的 rollouts
机器学习
2025-04-09 v2
摘要
模型基强化学习 (MBRL) 通过学习环境模型并从中生成合成 rollouts 来提高数据效率. 然而, 这些 rollouts 中积累的模型误差会扭曲数据分布, 从而影响策略学习并阻碍长期规划. 因此, 模型误差的积累是当前 MBRL 方法中的关键瓶颈. 我们提出 Infoprop, 一种将 aleatoric 不确定性与 epistemic 不确定性分离的模型基 rollout 机制, 从而降低后者对数据分布的影响. 此外, Infoprop 沿模型 rollout 跟踪积累的模型误差, 并提供终止准则以限制数据腐败. 我们在 Infoprop-Dyna algorithm 中展示了 Infoprop 的能力, 在 MuJoCo 常见基准任务上报告了 Dyna 风格 MBRL 的状态最佳性能, 并显著增加了 rollout 长度和数据质量.
引用
@article{arxiv.2501.16918,
title = {On Rollouts in Model-Based Reinforcement Learning},
author = {Bernd Frauenknecht and Devdutt Subhasish and Friedrich Solowjow and Sebastian Trimpe},
journal= {arXiv preprint arXiv:2501.16918},
year = {2025}
}