中文

利用因果图先验与后验采样进行强化学习

机器学习 2024-04-09 v2

摘要

后验采样允许利用关于环境转移动力学的先验知识来提高强化学习的样本效率。该先验通常指定为一类参数化分布,其设计在实践中可能繁琐,常导致选择无信息先验。本工作中,我们提出一种新颖的后验采样方法,其中先验以环境变量的(部分)因果图给出。后者通常更自然易设计,例如在医学治疗研究中列出生物特征间的已知因果依赖。具体地,我们提出一种称为 C-PSRL 的层次贝叶斯过程,在高层同时学习完整因果图,在低层学习所得因子化动力学的参数。我们提供了 C-PSRL 的贝叶斯遗憾分析,明确将遗憾率与先验知识程度相联系。在示例域中进行的数值评估证实,C-PSRL 相较无信息先验的后验采样大幅提高效率,同时性能接近于具有完整因果图的后验采样。

关键词

引用

@article{arxiv.2310.07518,
  title  = {Exploiting Causal Graph Priors with Posterior Sampling for Reinforcement Learning},
  author = {Mirco Mutti and Riccardo De Santi and Marcello Restelli and Alexander Marx and Giorgia Ramponi},
  journal= {arXiv preprint arXiv:2310.07518},
  year   = {2024}
}