中文

面向NeurIPS 2023 LLM效率挑战的nextAI解决方案

机器学习 2026-04-13 v1

摘要

大型语言模型 (LLM) 的快速演进显著影响了自然语言处理领域,但其日益复杂的模型引发了资源使用和透明度方面的担忧。为应对这些挑战,我们参加了NeurIPS LLM效率挑战,旨在受限条件下微调基础模型。我们的焦点是LLaMa2 700亿参数模型,在单块A100 40GB GPU上实现24小时内的优化。我们的 methodology 基于定制数据集构建,数据源来自多样化开源资源和基准测试,符合挑战的开源精神。我们的做法利用量化低秩适应 (QLoRA) 微调技术,结合诸如Flash Attention 2等先进注意力机制。我们实验了各种LoRA技术配置,优化计算效率与模型准确性之间的平衡。我们的微调策略基于创建和迭代测试多个数据集组成部分,最终选择一个在多样化任务和基准测试中表现稳健的数据集版本。我们工作的成果是一个高效微调的LLaMa2 70B模型,能在单GPU的约束条件下运行,显现出显著的资源利用率降低以及在多种 QA 基准测试中的高准确率。我们的研究证明了在资源受限环境中优化大规模模型的可行性,强调了LLM在实际应用中的潜力。

关键词

引用

@article{arxiv.2604.09034,
  title  = {The nextAI Solution to the NeurIPS 2023 LLM Efficiency Challenge},
  author = {Gyuwon Park and DongIl Shin and SolGil Oh and SangGi Ryu and Byung-Hak Kim},
  journal= {arXiv preprint arXiv:2604.09034},
  year   = {2026}
}