中文

为何长模型展开不必是坏的 Q 值估计

机器学习 2024-07-17 v1

摘要

本文探讨了使用长模型展开进行基于模型的离线强化学习。虽然部分文献因累积误差问题批评了这一方法,但许多实践者在实际应用中取得了成功。本文旨在表明长展开并必然导致指数级误差增长,实际上可以产生优于模型无方法的更佳 Q 值估计。这些发现可能增强强化学习技术的应用。

关键词

引用

@article{arxiv.2407.11751,
  title  = {Why long model-based rollouts are no reason for bad Q-value estimates},
  author = {Philipp Wissmann and Daniel Hein and Steffen Udluft and Volker Tresp},
  journal= {arXiv preprint arXiv:2407.11751},
  year   = {2024}
}

备注

Accepted at ESANN 2024