1-bit大语言模型时代的矩阵乘法与非矩阵乘法
人工智能
2024-08-30 v2 机器学习
摘要
1-bit大语言模型(LLM)的出现引起了广泛关注,并开辟了新的研究机会。然而,1-bit LLM仅通过将极端量化应用于投影层来改进模型的一部分,而注意力头保持不变。因此,为了避免未来研究中目标选择的根本性错误,理解1-bit LLM在计算和内存使用方面能带来的实际改进至关重要。在这项工作中,我们提出了一个针对1-bit LLM上下文定制的阿姆达尔定律的改编版本,该定律说明了1-bit LLM中的局部改进如何影响整体模型性能。通过大量实验,我们揭示了不同模型架构和硬件配置之间的关键细微差别,为1-bit LLM时代的未来研究提供了路线图。
引用
@article{arxiv.2408.11939,
title = {Matmul or No Matmul in the Era of 1-bit LLMs},
author = {Jinendra Malekar and Mohammed E. Elbtity and Ramtin Zand},
journal= {arXiv preprint arXiv:2408.11939},
year = {2024}
}
备注
Fixed Typo in title, Fixed typo in author name, fixed typo in amdhal's law para