SUMO:面向基于模型的离线强化学习的搜索式不确定性估计
机器学习
2024-11-13 v2
摘要
离线强化学习(RL)的性能会受到静态数据集大小和质量的限制。基于模型的离线RL通过生成合成样本来增强整体性能以解决这一问题。为了评估生成样本的可靠性,常会采用不确定性估计方法。然而,模型集成是最常用的不确定性估计方法,但并非总是最佳选择。本文提出了一种用于Model-based Offline RL的Search-based Uncertainty estimation method,称为SUMO(Search-based Uncertainty estimation for Model-based Offline RL)。SUMO通过测量合成样本与分布数据样本之间的交叉熵来表征合成样本的不确定性,并使用高效的搜索方法进行实现。如此一来,SUMO能够实现可靠的不确定性估计。我们将SUMO集成到包括MOPO和Adapted MOReL(AMOReL)在内的多个基于模型的离线RL算法中,并对它们进行理论分析。大量实验结果表明,SUMO能够提供更准确的不确定性估计并提升基本算法的性能。这表明SUMO在用于奖励惩罚或轨迹截断时,可是基于模型的离线RL的更好不确定性估计器。我们的代码已公开,并将开放源代码供进一步的研究和开发使用。
引用
@article{arxiv.2408.12970,
title = {SUMO: Search-Based Uncertainty Estimation for Model-Based Offline Reinforcement Learning},
author = {Zhongjian Qiao and Jiafei Lyu and Kechen Jiao and Qi Liu and Xiu Li},
journal= {arXiv preprint arXiv:2408.12970},
year = {2024}
}
备注
Submitted to AAAI2025