Auto-Agent-Distiller:基于神经架构搜索的高效深度强化学习智能体
机器学习
2025-01-07 v3
摘要
AlphaGo 令人惊叹的表现激发了人们对为众多现实应用(如智能机器人)开发深度强化学习(DRL)的爆发式兴趣。然而,DRL 通常过高的复杂度与许多 DRL 应用所需的实时控制和受限资源相矛盾,限制了 DRL 驱动智能设备的巨大潜力。尽管已有大量工作致力于压缩其他深度学习模型,现有研究几乎未触及 DRL 压缩的表层。本工作中,我们首先指出 DRL 存在一个可同时最大化测试分数与效率的最优模型规模,从而催生了对任务专用 DRL 智能体的需求。因此我们提出 Auto-Agent-Distiller(A2D)框架,据我们所知这是首个将神经架构搜索(NAS)应用于 DRL 的框架,可自动为各类任务搜索同时优化测试分数与效率的最优 DRL 智能体。具体而言,我们展示了朴素 NAS 因导致 DRL 训练稳定性高方差而容易在搜索最优智能体时失败,进而开发了一种新颖的蒸馏机制,从教师智能体的 actor 与 critic 中蒸馏知识,以稳定搜索过程并提升搜索所得智能体的最优性。大量实验与消融研究一致验证了我们的发现以及 A2D 的优势与通用性,在测试分数与效率上均优于人工设计的 DRL。所有代码将在录用后发布。
引用
@article{arxiv.2012.13091,
title = {Auto-Agent-Distiller: Towards Efficient Deep Reinforcement Learning Agents via Neural Architecture Search},
author = {Yonggan Fu and Zhongzhi Yu and Yongan Zhang and Yingyan Celine Lin},
journal= {arXiv preprint arXiv:2012.13091},
year = {2025}
}