论零初始化注意力:最优提示和门控因子估计
机器学习
2025-06-19 v3
摘要
LLaMA-Adapter 近期作为 LLaMA 模型的高效微调技术,利用零初始化注意力稳定训练并提升性能。然而,尽管其实证成功已显而易见,但零初始化注意力的理论基础仍 largely 未被探索。本文提供了严格的理论分析,建立了零初始化注意力与混合专家模型之间的联系。我们证明了线性提示、非线性提示以及门控函数均可进行最优估计,其中非线性提示在未来应用中提供了更大的灵活性。实验上,我们在开放 LLM 基准测试中验证了这些发现,表明非线性提示优于线性提示。值得注意的是,即使在有限训练数据下,两种提示类型均持续超越 vanilla 注意力,凸显了零初始化注意力的鲁棒性与适应性。
引用
@article{arxiv.2502.03029,
title = {On Zero-Initialized Attention: Optimal Prompt and Gating Factor Estimation},
author = {Nghiem T. Diep and Huy Nguyen and Chau Nguyen and Minh Le and Duy M. H. Nguyen and Daniel Sonntag and Mathias Niepert and Nhat Ho},
journal= {arXiv preprint arXiv:2502.03029},
year = {2025}
}
备注
Accepted at ICML 2025