Informed POMDP:在基于模型的强化学习中利用附加信息
机器学习
2025-06-09 v3
摘要
在这项工作中,我们通过考虑训练时可用的最终附加信息,推广了在 POMDP 中通过交互学习的问题。首先,我们引入了 informed POMDP,这是一种新的学习范式,在训练时的信息与执行时的观测之间提供了明确的区分。接下来,我们提出了一个利用这些信息来学习用于最优控制的历史充分统计量的目标。然后,我们调整这一 informed 目标以学习一个能够采样潜在轨迹的世界模型。最后,我们凭经验表明,在 Dreamer 算法中使用这种 informed 世界模型在多个环境中提高了学习速度。这些结果和所提出适应方法的简单性提倡,在使用基于模型的 RL 于 POMDP 中学习时,系统地考虑最终的附加信息。
引用
@article{arxiv.2306.11488,
title = {Informed POMDP: Leveraging Additional Information in Model-Based RL},
author = {Gaspard Lambrechts and Adrien Bolland and Damien Ernst},
journal= {arXiv preprint arXiv:2306.11488},
year = {2025}
}
备注
In Reinforcement Learning Conference, 2024. 10 pages, 22 pages total, 10 figures