具备MAD技能的预训练混合架构
机器学习
2025-10-01 v2 人工智能
计算与语言
摘要
尽管Transformer是现代大型语言模型(LM)的基础,但越来越多的替代架构带来了新的能力、前景和权衡。这使得选择合适的LM架构变得具有挑战性。最近提出的混合架构寻求一种集所有架构优点于一身的最佳方案。混合设计之所以困难,原因有二:它需要手动进行专家驱动的搜索,并且新的混合模型必须从头开始训练。我们提出了Manticore,这是一个通过自动化混合架构设计同时复用预训练模型来创建预训练混合模型的框架,从而解决了这些挑战。我们的方法通过引入简单的投影器来增强可微神经架构搜索(NAS)的思想,这些投影器能够在不同架构的预训练模块之间转换特征。然后,我们对结合了来自不同架构家族(如GPT系列和Mamba)的预训练模型的混合模型进行端到端微调。借助Manticore,我们无需训练多个模型即可进行LM选择,能够从现有的预训练模型构建预训练混合模型,并且能够对预训练混合模型进行编程以使其具备特定能力。Manticore混合模型与现有手动设计的混合模型性能相当,在Long Range Arena上取得了强劲的表现,并在各种自然语言任务上优于预训练的Transformer和状态空间模型。
引用
@article{arxiv.2406.00894,
title = {Pretrained Hybrids with MAD Skills},
author = {Nicholas Roberts and Samuel Guo and Zhiqi Gao and Satya Sai Srinath Namburi GNVV and Sonia Cromp and Chengjun Wu and Chengyu Duan and Frederic Sala},
journal= {arXiv preprint arXiv:2406.00894},
year = {2025}
}
备注
COLM 2025