为何长模型展开不必是坏的 Q 值估计
机器学习
2024-07-17 v1
摘要
本文探讨了使用长模型展开进行基于模型的离线强化学习。虽然部分文献因累积误差问题批评了这一方法,但许多实践者在实际应用中取得了成功。本文旨在表明长展开并必然导致指数级误差增长,实际上可以产生优于模型无方法的更佳 Q 值估计。这些发现可能增强强化学习技术的应用。
引用
@article{arxiv.2407.11751,
title = {Why long model-based rollouts are no reason for bad Q-value estimates},
author = {Philipp Wissmann and Daniel Hein and Steffen Udluft and Volker Tresp},
journal= {arXiv preprint arXiv:2407.11751},
year = {2024}
}
备注
Accepted at ESANN 2024