从实践视角解构神经正切核:它能否在无需训练的情况下被信任用于神经架构搜索?
机器学习
2022-03-29 v1 人工智能
摘要
在神经架构搜索(NAS)中,降低架构评估成本仍是最关键的挑战之一。在大量试图绕过将每个候选架构训练至收敛以进行评估的工作中,神经正切核(NTK)正作为一种有前景的理论框架崭露头角,可用于在初始化时估计神经架构的性能。在本工作中,我们重新审视了若干可从 NTK 导出的初始化时度量,并揭示了它们的关键缺陷。随后,通过对 NTK 时间演化的实证分析,我们推断现代神经架构表现出高度非线性特征,使得基于 NTK 的度量无法在缺乏一定量训练的情况下可靠地估计架构性能。为考虑此类非线性特征,我们引入了标签-梯度对齐(LGA),这是一种新颖的基于 NTK 的度量,其固有形式使其能够捕捉现代神经架构中存在的大量非线性优势。仅需极少量训练,LGA 便能与架构训练后测试精度达到有意义的秩相关水平。最后,我们证明 LGA 辅以少量训练轮次,能成功引导现有搜索算法以显著更低的搜索成本取得具竞争力的搜索性能。代码见:https://github.com/nutellamok/DemystifyingNTK。
引用
@article{arxiv.2203.14577,
title = {Demystifying the Neural Tangent Kernel from a Practical Perspective: Can it be trusted for Neural Architecture Search without training?},
author = {Jisoo Mok and Byunggook Na and Ji-Hoon Kim and Dongyoon Han and Sungroh Yoon},
journal= {arXiv preprint arXiv:2203.14577},
year = {2022}
}
备注
CVPR 2022