中文

用于数据高效策略搜索的深度高斯协方差网络与轨迹采样

机器学习 2024-03-26 v1 机器学习

摘要

概率世界模型通过利用其认知不确定性指导策略以改进探索并获取新样本,从而提高了基于模型的强化学习(MBRL)的数据效率。此外,与不考虑不确定性的解决方案相比,概率方法中的不确定性感知学习过程能够产生对噪声观测不那么敏感的鲁棒策略。我们提出将轨迹采样与深度高斯协方差网络(DGCN)相结合,为最优控制设置中的MBRL问题提供数据高效的解决方案。我们使用三种不同的概率世界模型(高斯过程、贝叶斯神经网络和DGCN)比较了轨迹采样与基于密度的近似方法在不确定性传播方面的表现。我们使用四个著名的测试环境提供了经验证据,表明我们的方法在样本效率上优于其他不确定性传播方法和概率模型的组合。在测试中,我们特别强调了所学策略对噪声初始状态的鲁棒性。

关键词

引用

@article{arxiv.2403.15908,
  title  = {Deep Gaussian Covariance Network with Trajectory Sampling for Data-Efficient Policy Search},
  author = {Can Bogoclu and Robert Vosshall and Kevin Cremanns and Dirk Roos},
  journal= {arXiv preprint arXiv:2403.15908},
  year   = {2024}
}