中文

低秩适配器与神经网络架构搜索结合用于LLM压缩

机器学习 2025-01-29 v1 人工智能 计算与语言

摘要

大型语言模型(LLMs)的快速扩张已对用于微调和部署的计算资源提出了重大挑战。最近出现的低秩适配器在LLMs的参数高效微调(PEFT)方面显示出其有效性。本文为综述性论文,全面讨论了将低秩表示与神经网络架构搜索(NAS)技术相结合的创新方法,特别是 weight-sharing super-networks。通过整合这些方法,开发出了用于压缩和微调大型预训练模型的 robust 解决方案。我们的分析突显了这些组合策略的潜力,以大众化LLMs的使用,使其更易于在资源受限的环境中部署。 resulting 模型 exhibit reduced memory footprints and faster inference times,为LLMs的更实际和可扩展应用开辟了道路。模型和代码均可在 https://github.com/IntelLabs/Hardware-Aware-Automated-Machine-Learning 获取。

关键词

引用

@article{arxiv.2501.16372,
  title  = {Low-Rank Adapters Meet Neural Architecture Search for LLM Compression},
  author = {J. Pablo Muñoz and Jinjie Yuan and Nilesh Jain},
  journal= {arXiv preprint arXiv:2501.16372},
  year   = {2025}
}

备注

AAAI-25 Workshop on Connecting Low-rank Representations in AI