NITRO:面面向英特尔笔记本 NPU 的 LLM 推理
计算与语言
2024-12-17 v1 人工智能
摘要
大型语言模型(LLM)已成为自然语言处理中至关重要的工具,广泛应用于诸如 ChatGPT 和 Gemini 等聊天机器人中,是人工智能领域的核心研究方向。值得关注的一个领域是设计专为这些 AI 应用而设计的硬件,其中一种示例是神经处理器(NPU)。2023 年,英特尔发布的代号为 Meteor Lake 的英特尔 Core Ultra 处理器,集成了 CPU、GPU 和 NPU 系统级芯片。然而,英特尔的 OpenVINO 框架官方软件支持仅限于静态模型推理,无法开箱即用地支持 LLM 中基于自回归 token 生成的动态推理。为此,我们提出了 NITRO(NPU Inference for Transformers Optimization),这是一个基于 OpenVINO 构建的 Python 框架,用于在 NPU 上支持文本和聊天生成。本文详细讨论了为实现推理所做的关键变更、一些性能基准测试,以及未来改进该软件包的步骤。NITRO 的代码仓库可在此处找到:https://github.com/abdelfattah-lab/nitro。
引用
@article{arxiv.2412.11053,
title = {NITRO: LLM Inference on Intel Laptop NPUs},
author = {Anthony Fei and Mohamed S. Abdelfattah},
journal= {arXiv preprint arXiv:2412.11053},
year = {2024}
}
备注
11 pages, 7 figures