LoCA 遗憾值:一种评估强化学习中基于模型行为的一致度量
机器学习
2020-12-04 v2 人工智能
机器学习
摘要
深度基于模型的强化学习(RL)有潜力大幅提高深度 RL 的样本效率。尽管长期以来各种挑战阻碍了其发展,但近期已有若干论文报道了深度基于模型方法的成功。这是一个很好的进展,但缺乏一致的度量来评估此类方法,使得比较各种方法变得困难。例如,常见的单任务样本效率度量将基于模型学习带来的改进与表征学习等其他方面混为一谈,难以评估基于模型的 RL 的真正进展。为此,受神经科学中检测人类和动物基于模型行为的启发,我们提出了一种评估 RL 方法基于模型行为的实验设置。基于该设置得到的度量——局部变化适应(LoCA)遗憾值,衡量一个 RL 方法对环境局部变化的适应速度。我们的度量能够识别基于模型的行为,即使该方法使用了较差的表征,并能揭示该方法的行为距离最优基于模型行为有多近。我们利用该设置评估了 MuZero 在经典 Mountain Car 任务变体上的基于模型行为。
引用
@article{arxiv.2007.03158,
title = {The LoCA Regret: A Consistent Metric to Evaluate Model-Based Behavior in Reinforcement Learning},
author = {Harm van Seijen and Hadi Nekoei and Evan Racah and Sarath Chandar},
journal= {arXiv preprint arXiv:2007.03158},
year = {2020}
}
备注
NeurIPS 2020, code: https://github.com/chandar-lab/LoCA