关于基于模型的强化学习中损失函数与误差累积的注记
机器学习
2024-04-16 v1 人工智能
机器学习
摘要
本注记澄清了在深度强化学习背景下,围绕基于模型的强化学习及其理论理解的一些混淆(或许也引发了更多混淆)。讨论的主要主题是:(1) 如何调和基于模型的强化学习在误差累积方面不佳的经验声誉与其优越的理论性质,以及 (2) 经验上流行的损失函数的局限性。对于后者,我们构造了“MuZero 损失”的具体反例,以表明它不仅在随机环境中会失败,而且在数据提供充分覆盖的确定性环境中也会遭受指数级的样本复杂度。
引用
@article{arxiv.2404.09946,
title = {A Note on Loss Functions and Error Compounding in Model-based Reinforcement Learning},
author = {Nan Jiang},
journal= {arXiv preprint arXiv:2404.09946},
year = {2024}
}