中文

LLM 的特征空间精准分解:为何、何时以及如何进行?

计算与语言 2024-05-24 v1 人工智能

摘要

权重与特征空间的低秩近似能够提升深度学习模型的性能,无论是在改善泛化能力还是降低推理延迟方面。然而,对于这些近似*如何*、*何时*以及*为何*对大型语言模型(LLM)有帮助,目前尚无明确共识。在本研究中,我们实证研究了权重与特征空间分解在基于 Transformer 的 LLM 中的有效性。我们证明,精准分解不仅提供了关于压缩与语言建模性能之间权衡的关键见解,而且有时还能提升 LLM 的常识推理性能。我们的实证分析识别出内在表现出低秩结构的特定网络区段。此外,我们将研究扩展到低秩近似对模型偏差的影响。总体而言,我们的发现为优化 LLM 提供了新视角,表明低秩近似不仅是提升性能的工具,还可能成为纠正这些模型内部偏差的手段。我们的代码可在 GitHub 获取。

关键词

引用

@article{arxiv.2405.13039,
  title  = {Surgical Feature-Space Decomposition of LLMs: Why, When and How?},
  author = {Arnav Chavan and Nahush Lele and Deepak Gupta},
  journal= {arXiv preprint arXiv:2405.13039},
  year   = {2024}
}

备注

Accepted at ACL 2024