SimuDICE:通过世界模型更新与DICE估计进行离线策略优化
机器学习
2024-12-10 v1 人工智能
摘要
在离线强化学习中,由于目标策略与用于收集数据的行为策略之间存在分布不匹配,以及样本量有限,从预先收集的经验集中推导出有效策略具有挑战性。基于模型的强化学习通过利用学习到的环境动态模型生成模拟经验来提高样本效率。然而,这些合成经验往往同样遭受分布不匹配的困扰。为应对这些挑战,我们提出了SimuDICE,一个通过世界模型生成的合成经验迭代优化初始策略的框架。SimuDICE通过基于稳态分布校正估计(DICE)和模型预测置信度来调整状态-动作对的采样概率,从而提升合成经验的质量。该方法通过平衡与频繁遇到经验相似的样本和存在分布不匹配的样本来指导策略优化。实验结果表明,SimuDICE在性能上与现有算法相当,同时需要更少的预收集经验和规划步骤,并且在不同的数据收集策略下保持鲁棒性。
引用
@article{arxiv.2412.06486,
title = {SimuDICE: Offline Policy Optimization Through World Model Updates and DICE Estimation},
author = {Catalin E. Brita and Stephan Bongers and Frans A. Oliehoek},
journal= {arXiv preprint arXiv:2412.06486},
year = {2024}
}
备注
Published at BNAIC/BeNeLearn 2024