LLaMA-NAS: 大型語言模型的高效神經網絡架構搜尋
人工智能
2024-05-29 v1
摘要
現代大型語言模型(LLM)在解決自然語言處理、複雜推理、情感分析等任務方面的能力極其驚人,這促使其廣泛應用。然而,這些能力伴隨著極高的內存和計算成本,限制了LLM在大多數硬件平台上的使用。為緩解此問題,我們提出一種有效的方法,基於LLaMA2-7B尋找Pareto最優網絡架構。具體而言,我們僅對LLaMA2-7B進行一次微調,然後應用基於遺傳算法的搜尋以查找較小、較低計算複雜度的網絡架構。我們展示,對於某些標準基準任務,預訓練的LLaMA2-7B網絡是不必要的大型和複雜。更具體地說,我們證明對於某些任務,模型大小可減少1.5倍,吞吐量提升1.3倍,且準確率下降幅度可忽略不計。除了找到較小、更高性能的網絡架構外,我們的方法在有效性和效率上都優於某些剪枝或稀疏化技術。最後,我們展示量化對我們的方法是補充性的,且我們所發現的網絡大小和複雜度可以使用量化進一步降低。我們相信,我們的工作提供了一種自動創建可在較低成本和更易於獲得的硬件平台上使用的LLM的方法。
引用
@article{arxiv.2405.18377,
title = {LLaMA-NAS: Efficient Neural Architecture Search for Large Language Models},
author = {Anthony Sarah and Sharath Nittur Sridhar and Maciej Szankin and Sairam Sundaresan},
journal= {arXiv preprint arXiv:2405.18377},
year = {2024}
}