作为混合推断的控制
机器学习
2020-07-14 v1 人工智能
机器学习
摘要
强化学习领域可分为基于模型与无模型的方法。在此,我们通过在“作为混合推断的控制”(CHI)框架内将无模型策略优化视为摊销变分推断、将基于模型的规划视为迭代变分推断,统一了这些途径。我们给出了 CHI 的一种实现,它自然地调节迭代推断与摊销推断之间的平衡。通过一个教学实验,我们证明了所提算法在学习开始时以基于模型的方式运行,然后在收集到足够数据后收敛为无模型算法。我们在连续控制基准上验证了算法的可扩展性,表明其优于强大的无模型与基于模型基线。因此,CHI 提供了一个原则性框架,可在保留无模型策略优化渐近性能的同时利用基于模型规划的采样效率。
引用
@article{arxiv.2007.05838,
title = {Control as Hybrid Inference},
author = {Alexander Tschantz and Beren Millidge and Anil K. Seth and Christopher L. Buckley},
journal= {arXiv preprint arXiv:2007.05838},
year = {2020}
}