CATE:基于 Transformer 的计算感知神经架构编码
机器学习
2021-06-15 v2
摘要
近期工作(White et al., 2020a; Yan et al., 2020)展示了架构编码在神经架构搜索(NAS)中的重要性。这些编码对神经架构的结构或计算信息进行编码。相较于结构感知编码,计算感知编码将具有相似精度的架构映射到同一区域,从而提升下游架构搜索性能(Zhang et al., 2019; White et al., 2020a)。在本工作中,我们引入一种称为 CATE 的基于 Transformer 的计算感知编码方法。不同于现有的基于固定变换(如路径编码)的计算感知编码,CATE 采用成对预训练方案,利用带交叉注意力的 Transformer 学习计算感知编码。此类学习得到的编码包含神经架构的密集且上下文化的计算信息。我们在小型与大型搜索空间下,针对三种主要依赖编码的 NAS 子例程,将 CATE 与十一种编码进行比较。我们的实验表明 CATE 有益于下游搜索,尤其在大型搜索空间中。此外,搜索空间外实验展示了其在训练所用搜索空间之外的优越泛化能力。我们的代码见:https://github.com/MSU-MLSys-Lab/CATE。
引用
@article{arxiv.2102.07108,
title = {CATE: Computation-aware Neural Architecture Encoding with Transformers},
author = {Shen Yan and Kaiqiang Song and Fei Liu and Mi Zhang},
journal= {arXiv preprint arXiv:2102.07108},
year = {2021}
}
备注
ICML 2021 camera-ready. Code: https://github.com/MSU-MLSys-Lab/CATE