中文

蒸馏策略优化

机器学习 2023-09-28 v5 人工智能

摘要

虽然on-policy算法以其稳定性著称,但它们往往需要大量样本。相比之下,利用过往经验的off-policy算法被认为样本高效但往往表现出不稳定性。我们能否开发一种既利用off-policy数据优势又保持稳定学习的算法?在本文中,我们引入一种actor-critic学习框架,该框架协调两种数据源用于评估与控制,促进快速学习并与on-policy算法的灵活集成。该框架包含方差缩减机制,包括统一优势估计器(UAE)与残差基线,提升了on-policy与off-policy学习的效能。我们的实证结果显示on-policy算法的样本效率得到实质性增强,有效弥合了与off-policy方法之间的差距。它展示了我们的方法作为一种新颖学习范式的潜力。

关键词

引用

@article{arxiv.2302.00533,
  title  = {Distillation Policy Optimization},
  author = {Jianfei Ma},
  journal= {arXiv preprint arXiv:2302.00533},
  year   = {2023}
}