基于多因子优化的深度强化学习模型同步演化
机器学习
2020-03-24 v2 人工智能
神经与进化计算
机器学习
摘要
近年来,多因子优化(MFO)在研究界获得了显著关注。MFO 以其同时高效处理多个优化任务、并在任务间传递信息以提升收敛速度的内在能力而著称。另一方面,深度 Q 学习(DQL)在机器学习领域的飞跃使得应对前所未有复杂度的强化学习(RL)问题成为可能。遗憾的是,复杂的 DQL 模型常因探索不足或奖励稀疏而难以收敛至最优策略。为克服这些缺陷,预训练模型被广泛通过迁移学习加以利用,将源任务中获得的知识外推至目标任务。此外,元启发式优化已被证明能缓解 DQL 模型的探索不足。本工作提出一种 MFO 框架,能够同步演化多个 DQL 模型以求解相互关联的 RL 任务。具体而言,我们所提框架融合了元启发式优化、迁移学习与 DQL 的优势,以自动化分布式 RL 智能体的知识迁移与策略学习过程。文中给出并讨论了充分实验,以评估该框架性能、其与传统迁移学习方法在收敛性、速度及策略质量上的比较,以及搜索过程中发现并利用的任务间关系。
引用
@article{arxiv.2002.12133,
title = {Simultaneously Evolving Deep Reinforcement Learning Models using Multifactorial Optimization},
author = {Aritz D. Martinez and Eneko Osaba and Javier Del Ser and Francisco Herrera},
journal= {arXiv preprint arXiv:2002.12133},
year = {2020}
}
备注
8 pages, 5 figures, submitted to IEEE Conference on Evolutionary Computation 2020 (IEEE CEC)