中文

亲爱的,我把 Actor 缩小了:Actor-Critic 强化学习中用小 Actor 保持性能的案例研究

机器学习 2021-06-22 v3 机器人学

摘要

Actor-Critic 强化学习算法中的 actor 和 critic 在功能上是分离的,但它们通常使用相同的网络架构。本案例研究在独立考虑 actor 和 critic 架构时,探讨了网络规模对性能的影响。通过放宽架构对称的假设,较小的 actor 往往能够取得与其对称对应物相当的策略性能。我们的实验显示在 9 个独立任务上,多种 actor-critic 算法中网络权重数量最多减少 99%,平均减少 77%。鉴于降低 actor 复杂度会直接减少运行时推理成本,我们认为 actor 和 critic 的配置是 actor-critic 设计中值得独立考虑的方面,特别是在资源受限的应用或同时部署多个 actor 时。

关键词

引用

@article{arxiv.2102.11893,
  title  = {Honey, I Shrunk The Actor: A Case Study on Preserving Performance with Smaller Actors in Actor-Critic RL},
  author = {Siddharth Mysore and Bassel Mabsout and Renato Mancuso and Kate Saenko},
  journal= {arXiv preprint arXiv:2102.11893},
  year   = {2021}
}

备注

Accepted to the IEEE Conference on Games 2021