ZeroLM:面向语言模型的无数据 Transformer 架构搜索
计算与语言
2025-03-25 v1
摘要
神经架构搜索(NAS)为自动化神经网络架构设计提供了系统性框架,但其广泛采用受到计算需求过高的阻碍。现有的零成本代理方法虽然减少了搜索开销,但在架构排名任务中表现不佳,特别是对于 Transformer 模型,其表现往往不如简单的参数计数指标。当前的自动化代理发现方法存在搜索时间长、易受数据过拟合影响以及结构复杂等问题。本文引入了一种新颖的零成本代理方法,该方法通过高效的权重统计计算来量化模型容量,同时将 Transformer 架构分解为功能不同的子模块,从而优化它们对整体性能的贡献平衡。我们的全面评估证明了该方法的优越性,在 FlexiBERT 基准上实现了 0.76 的 Spearman rho 和 0.53 的 Kendall tau。所提出的方法展现出卓越的计算效率,同时在多种 NAS 基准任务中保持稳健的性能,为大规模架构搜索提供了实用解决方案。
引用
@article{arxiv.2503.18646,
title = {ZeroLM: Data-Free Transformer Architecture Search for Language Models},
author = {Zhen-Song Chen and Hong-Wei Ding and Xian-Jia Wang and Witold Pedrycz},
journal= {arXiv preprint arXiv:2503.18646},
year = {2025}
}