演员-评论家方法隐式偏向于高熵最优策略
机器学习
2022-03-15 v2
摘要
我们表明,最简单的演员-评论家方法——即一个线性 softmax 策略通过与线性 MDP 交互并用 TD 更新、但无任何显式正则化或探索——不仅找到一个最优策略,而且偏好高熵最优策略。为展示该偏置的强度,该算法不仅无正则化、无投影、无如 ε-greedy 之类的探索,而且还在无重置的单一轨迹上训练。高熵偏置的关键后果是:在所有先前工作中以某种形式存在的对 MDP 的均匀混合假设可以被舍弃:高熵偏置的隐式正则化足以保证所有链混合,并以高概率达到最优策略。作为辅助贡献,本工作通过将演员更新写为显式镜像下降,解耦了演员与评论家的关联,提供了在策略空间 KL 球内一致界定混合时间的工具,并给出了一种无投影的 TD 分析及其自身的隐式偏置,该分析可从非混合的初始分布启动。
引用
@article{arxiv.2110.11280,
title = {Actor-critic is implicitly biased towards high entropy optimal policies},
author = {Yuzheng Hu and Ziwei Ji and Matus Telgarsky},
journal= {arXiv preprint arXiv:2110.11280},
year = {2022}
}
备注
v2 primarily improved the proofs, with minimal changes to the body