中文

OffCon$^3$: 究竟什么是当前最优方法

机器学习 2021-03-16 v2 最优化与控制

摘要

SAC 和 TD3 是处理无模型连续控制任务的两种流行方法。乍看之下这些方法似乎相当不同;SAC 旨在通过最小化随机提议策略与假设的能量基软 Q 函数策略之间的 KL 散度来求解熵增广 MDP,而 TD3 派生自 DPG,其使用确定性策略沿值函数执行策略梯度上升。实际上,这两种方法极为相似,并且属于我们称之为“离策略连续广义策略迭代”的方法族。这解释了它们在大多数连续控制基准中相似的表现,并且事实上当超参数匹配时,它们的表现可在统计上无法区分。为了进一步消除由实现带来的任何差异,我们提供 OffCon3^3(Off-Policy Continuous Control: Consolidated),一个包含两种算法当前最优版本代码库。

关键词

引用

@article{arxiv.2101.11331,
  title  = {OffCon$^3$: What is state of the art anyway?},
  author = {Philip J. Ball and Stephen J. Roberts},
  journal= {arXiv preprint arXiv:2101.11331},
  year   = {2021}
}