高效语言模型的弹性架构搜索
计算与语言
2025-11-03 v1 人工智能
机器学习
神经与进化计算
摘要
随着大规模预训练语言模型在自然语言理解(NLU)任务中发挥越来越重要的作用,其巨大的计算和内存需求引发了重大的经济和环境关注。为应对这些挑战,本文引入了弹性语言模型(ELM),这是一种针对紧凑型语言模型优化的新型神经网络架构搜索(NAS)方法。ELM通过引入具有高效变换器模块和用于维度和头数动态调整的动态模块的灵活搜索空间,扩展了现有NAS方法。这些创新增强了搜索过程的效率和灵活性,促进了对模型架构进行更深入、更有效的探索。我们还引入了新的知识蒸馏损失函数,以保留每个模块的独特特征,以提高搜索过程中对架构选择的区分度。在掩码语言建模和因果语言建模任务上的实验表明,ELM发现的模型显著优于现有方法。
引用
@article{arxiv.2510.27037,
title = {Elastic Architecture Search for Efficient Language Models},
author = {Shang Wang},
journal= {arXiv preprint arXiv:2510.27037},
year = {2025}
}
备注
ICME 2025