基于 W-PCA 的无梯度轻量级语言模型高效搜索代理
计算与语言
2025-11-03 v1 人工智能
机器学习
神经与进化计算
摘要
高效自然语言处理(NLP)系统的需求推动了轻量级语言模型的开发。此领域的先前工作主要关注手动设计或基于训练的神经网络结构搜索(NAS)方法。最近提出了无需训练即可评估语言模型的零样本 NAS 方法。然而,现存的零样本 NAS 方法常面临评估指标偏差和计算效率低下的挑战。本文引入权重加权主成分分析(W-PCA),一种专为轻量级语言模型设计的新型零样本 NAS 方法。我们的方法利用两个评估代理:参数数量以及在前馈神经网络(FFN)层中累计贡献超过 的主成分数量。此外,通过消除梯度计算的需求,我们优化了评估时间,从而提高了设计和评估轻量级语言模型的效率。我们在 GLUE 与 SQuAD 数据集上进行比较分析,结果表明该方法在训练时间上显著优于 one-shot NAS 方法,在测试阶段得分也高于以往基于训练的方法。此外,我们对来自 FlexiBERT 搜索空间抽样的数据集进行排序评估。我们的做法在排序相关性方面表现出优势,进一步缩短求解时间,优于其他需要梯度计算的零样本 NAS 方法。
引用
@article{arxiv.2504.15983,
title = {W-PCA Based Gradient-Free Proxy for Efficient Search of Lightweight Language Models},
author = {Shang Wang},
journal= {arXiv preprint arXiv:2504.15983},
year = {2025}
}
备注
ICLR 2025