中文

HPC-LLM:针对 HPC 支持的实用领域适应与检索增强生成

机器学习 2026-05-19 v1

摘要

现代科学研究越来越依赖高性能计算(HPC)基础设施,但许多研究人员在与集群环境、作业调度器、GPU 资源和并行计算框架交互时面临显著的运营障碍。通用大语言模型(LLM)提供了有用的编码辅助,但往往缺乏可靠 HPC 支持所需的领域特定运营知识。本文提出了 HPC-LLM,一个集成了检索增强与领域适应的助手,旨在支持常见的 HPC 工作流程,包括 Slurm 调度、MPI 执行、GPU 利用、文件系统管理和集群排错。该框架集成了自动文档摄取、密集检索、使用 QLoRA 的轻量级领域适应以及模块化编排管道中的本地推理。为支持领域适应,我们从公开的大学 HPC 文档、精选的运营实例以及从检索到的 HPC 内容生成的合成指令-答案对中构建了 HPC 导向语料库。该数据集包含约 9000 至 24000 条涵盖作业调度、GPU 计算、分布式训练、存储系统和集群管理等主题的 HPC 专注训练示例。我们使用 QLoRA 对 Llama 3.1 8B 进行微调,并在 JetStream2 基础设施上对结果模型在检索增强设置下与几个开源权重基线进行评估。实验结果表明,适配后的 8B 模型在显著降低 GPU 内存要求和推理延迟的前提下,实现了与大型通用模型相当的性能;特别是,该适配模型接近 Qwen 2.5 14B 的性能,而所需计算资源显著更少。

关键词

引用

@article{arxiv.2605.16347,
  title  = {HPC-LLM: Practical Domain Adaptation and Retrieval-Augmented Generation for HPC Support},
  author = {Nourin Shahin and Izzat Alsmadi},
  journal= {arXiv preprint arXiv:2605.16347},
  year   = {2026}
}