基于保守模型 actor-critic 的样本高效强化学习
机器学习
2021-12-21 v1 人工智能
摘要
基于模型的强化学习算法旨在学习环境模型以进行决策,比无模型算法更具样本效率。基于模型方法的样本效率取决于模型能否良好地逼近环境。然而,学习准确的模型具有挑战性,尤其在复杂和噪声环境中。为解决该问题,我们提出保守模型 actor-critic (CMBAC),一种无需强烈依赖准确学习模型即可实现高样本效率的新方法。具体而言,CMBAC 从一组不准确的模型中学习 Q 值函数的多个估计,并使用底部 k 个估计的平均值——一种保守估计——来优化策略。CMBAC 的一个吸引人特性是,保守估计有效鼓励智能体避免不可靠的“有前景动作”——即仅在少数模型中价值较高的动作。实验表明,在多个具有挑战性的任务上,CMBAC 在样本效率方面显著优于最先进方法,且所提方法在噪声环境中比先前方法更鲁棒。
引用
@article{arxiv.2112.10504,
title = {Sample-Efficient Reinforcement Learning via Conservative Model-Based Actor-Critic},
author = {Zhihai Wang and Jie Wang and Qi Zhou and Bin Li and Houqiang Li},
journal= {arXiv preprint arXiv:2112.10504},
year = {2021}
}
备注
Accepted to AAAI22