中文

重新思考强化学习中用于泛化的价值函数学习

机器学习 2023-01-10 v2 人工智能

摘要

我们的工作专注于在多个视觉多样化环境中训练 RL 智能体,以改善观测泛化性能。在先前的方法中,策略和值网络使用分离的网络架构单独优化,以避免干扰并获得更准确的价值函数。我们指出,在多环境设定下,值网络比传统的单环境设定更难以优化且更容易记忆训练数据。此外,我们发现对值网络进行适当的正则化对于提升训练和测试性能是必要的。为此,我们提出了延迟评论家策略梯度(DCPG),一种通过对值网络以低于策略网络的频率并使用更多训练数据来优化从而隐式惩罚价值估计的策略梯度算法。这可以使用单一统一网络架构实现。此外,我们引入了一个简单的自监督任务,使用单个判别器学习环境的前向和逆向动力学,其可与值网络联合优化。我们提出的算法在 Procgen Benchmark 上显著改善了观测泛化性能和样本效率。

关键词

引用

@article{arxiv.2210.09960,
  title  = {Rethinking Value Function Learning for Generalization in Reinforcement Learning},
  author = {Seungyong Moon and JunYeong Lee and Hyun Oh Song},
  journal= {arXiv preprint arXiv:2210.09960},
  year   = {2023}
}

备注

NeurIPS 2022 final camera-ready