中文

乐观的评论者能够赋能小型演员

机器学习 2025-08-15 v3 机器学习

摘要

Actor-critic 方法一直是深度强化学习近期诸多进展的核心。最常见的方法是使用对称架构,即演员和评论者具有相同的网络拓扑结构和参数数量。然而,近期的研究主张非对称设置的优势,特别是使用更小的演员。我们进行了广泛的实证调查与分析以更好地理解其影响,并发现通常情况下,更小的演员会导致性能下降并使评论者过拟合。我们的分析表明,由价值低估导致的不良数据收集是造成该行为的主要原因之一,并进一步强调了评论者在缓解此问题中可发挥的关键作用。我们探索了多种技术来缓解观察到的价值低估问题,从而为非对称 actor-critic 方法的进一步研究提供支持。

关键词

引用

@article{arxiv.2506.01016,
  title  = {Optimistic critics can empower small actors},
  author = {Olya Mastikhina and Dhruv Sreenivas and Pablo Samuel Castro},
  journal= {arXiv preprint arXiv:2506.01016},
  year   = {2025}
}

备注

RLC 2025