中文

LLaMA 2 推理微调:面向最优效率的语言实现比较研究

机器学习 2025-02-05 v1 人工智能

摘要

本文提出了一项旨在优化 Llama2 推理的比较研究,这是机器学习与自然语言处理 (NLP) 的一个关键方面。我们评估了多种编程语言和框架,包括 TensorFlow、PyTorch、Python、Mojo、C++ 和 Java,通过广泛的基准测试分析了它们在速度、内存消耗和实现便捷性方面的性能。我们突出了每种方法的优势与局限,并提出了针对并行处理和硬件利用的优化策略。此外,我们研究了 Mojo SDK,这是一个专为 Apple Silicon 上的大语言模型 (LLM) 推理设计的新型框架,并将其性能与 C、C++、Rust、Zig、Go 和 Julia 的实现进行了基准测试对比。我们在 Apple M1 Max 上进行的实验表明,Mojo SDK 具有竞争力的性能、易用性以及无缝的 Python 兼容性,使其成为 Apple Silicon 上 LLM 推理的有力替代方案。我们还讨论了在资源受限硬件上部署 LLM 的更广泛影响,并指出了未来研究的潜在方向。

关键词

引用

@article{arxiv.2502.01651,
  title  = {Fine-tuning LLaMA 2 interference: a comparative study of language implementations for optimal efficiency},
  author = {Sazzad Hossain and Touhidul Alam Seyam and Avijit Chowdhury and Munis Xamidov and Rajib Ghose and Abhijit Pathak},
  journal= {arXiv preprint arXiv:2502.01651},
  year   = {2025}
}

备注

11 pages, conference paper. International conference on Artificial Intelligence and Future Civilization