中文

基于非平稳策略梯度的多目标神经架构搜索

机器学习 2020-02-03 v2 机器学习

摘要

多目标神经架构搜索(NAS)旨在在存在多个冲突目标的情况下发现新颖架构。尽管近期取得了进展,准确且高效地逼近完整帕累托前沿的问题仍然具有挑战性。在本工作中,我们探索了基于强化学习(RL)的非平稳策略梯度(NPG)这一新颖范式。NPG利用非平稳奖励函数,并促使策略持续自适应以高效捕捉整个帕累托前沿。我们引入了两种结合标量化与进化等主流范式要素的新颖奖励函数。为处理非平稳性,我们提出了一种使用带预热重启的余弦温度衰减的新探索方案。为实现快速而准确的架构评估,我们引入了一种新颖的预训练共享模型,并在整个训练过程中持续微调。我们在多个数据集上的大量实验研究表明,我们的框架能够以很快的速度较好地逼近完整帕累托前沿。此外,与其他多目标NAS方法以及相似网络规模下的其他单目标NAS方法相比,我们所发现的单元能够实现卓越的预测性能。我们的工作展示了NPG作为一种简单、高效且有效的多目标NAS范式的潜力。

关键词

引用

@article{arxiv.2001.08437,
  title  = {Multi-objective Neural Architecture Search via Non-stationary Policy Gradient},
  author = {Zewei Chen and Fengwei Zhou and George Trimponias and Zhenguo Li},
  journal= {arXiv preprint arXiv:2001.08437},
  year   = {2020}
}