DreamerV3-XP: 通过不确定性估计优化探索
机器学习
2025-10-27 v1 人工智能
摘要
我们介绍了DreamerV3-XP,这是DreamerV3的一个扩展,改进了探索和学习效率。这包括(i)一个优先回放缓冲区,根据回报、重建损失和价值误差对轨迹进行评分;以及(ii)一个基于世界模型集成对预测环境奖励的分歧的内在奖励。DreamerV3-XP在Atari100k和DeepMind Control视觉基准任务的一个子集上进行了评估,确认了原始DreamerV3的结果,并表明我们的扩展导致了更快的学习和更低的动力学模型损失,特别是在稀疏奖励设置中。
引用
@article{arxiv.2510.21418,
title = {DreamerV3-XP: Optimizing exploration through uncertainty estimation},
author = {Lukas Bierling and Davide Pasero and Jan-Henrik Bertrand and Kiki Van Gerwen},
journal= {arXiv preprint arXiv:2510.21418},
year = {2025}
}