中文

NN-Former:重新思考神经网络拓扑结构中的图结构

机器学习 2025-07-02 v1 人工智能

摘要

深度学习的应用日益增长,使得高效的网络设计与部署成为必要任务,进而使神经预测器成为估算如准确率和延迟等属性的关键工具。最近,图神经网络(GNN)和 Transformer 在表示神经网络结构方面展现出前景。然而,两种方法各有局限:GNN 难以表示复杂特征,而 Transformer 在网络深度增加时泛化能力较差。为缓解上述问题,本文重新思考了神经网络拓扑结构,指出兄弟节点在先前研究中被忽略了。我们因此提出一种新型预测器,融合 GNN 与 Transformer 的优势,以学习增强后的拓扑结构。我们引入一种新型 token mixer,考虑兄弟节点的因素,并提出一种名为双向图同构前馈网络的全新通道混合器。我们的方法在准确率和延迟预测方面始终实现优异的性能,为学习有向无环图(DAG)拓扑结构提供了宝贵的见解。代码已公开于 https://github.com/XuRuihan/NNFormer。

关键词

引用

@article{arxiv.2507.00880,
  title  = {NN-Former: Rethinking Graph Structure in Neural Architecture Representation},
  author = {Ruihan Xu and Haokui Zhang and Yaowei Wang and Wei Zeng and Shiliang Zhang},
  journal= {arXiv preprint arXiv:2507.00880},
  year   = {2025}
}

备注

Accepted to CVPR 2025. Code is avaiable at https://github.com/XuRuihan/NNFormer