深度强化学习预训练中的进化策略
机器学习
2026-04-02 v1
摘要
尽管深度强化学习在解决复杂决策问题方面表现卓越,但需要大量计算资源并需精细调整参数才能开发出成功的策略。进化策略提供一种更直接、无导数的方法,计算成本较低且部署更简单。然而,进化策略通常不达到 DRL 所达到的性能水平,这使人质疑其在更具挑战性的场景中的适用性。本研究检验了进化策略和 DRL 在不同难度任务上的表现,包括 Flappy Bird、Breakout 和 MuJoCo 环境,以及进化策略能否用作初始训练来增强 DRL 算法。结果表明,进化策略不一致地比 DRL 更快训练。在较简单环境(Flappy Bird)中用作预训练步骤时,仅提供有限的好处;在更复杂的任务(Breakout 和 MuJoCo Walker)中,应用不同参数设置时,对训练效率和稳定性的改进最小或为零。
关键词
引用
@article{arxiv.2604.00066,
title = {Evolution Strategies for Deep RL pretraining},
author = {Adrian Martínez and Ananya Gupta and Hanka Goralija and Mario Rico and Saúl Fenollosa and Tamar Alphaidze},
journal= {arXiv preprint arXiv:2604.00066},
year = {2026}
}
备注
12 pages, 3 figures, 2 algorithms; EE-568 Reinforcement learning course project