迈向 EnergyGPT:面向能源领域的大型语言模型
计算与语言
2026-04-15 v3
摘要
大型语言模型在各个领域展现出了令人瞩目的能力。然而,其通用性质往往限制了它们在能源等专业领域的有效性,这些领域需要深厚的技术专长和精确的领域知识。在本文中,我们介绍了 EnergyGPT,一种为能源领域量身定制的领域专用语言模型,该模型通过在高质量、精选的能源相关文本语料库上微调 LLaMA 3.1-8B 模型开发而成。我们考虑了两种适配策略:全参数监督微调变体和仅更新模型参数中一小部分的参数高效 LoRA 变体。我们提出了完整的开发流程,包括数据收集与筛选、模型微调、基准设计与 LLM 评判选择、评估和部署。通过这项工作,我们证明了我们的训练策略能够在无需大规模基础设施的情况下提升领域相关性和性能。通过使用领域特定问答基准评估两种 EnergyGPT 变体的性能,我们的结果表明,适配后的模型在大多数与能源相关的语言理解和生成任务中始终优于基础模型,其中 LoRA 变体在训练成本大幅降低的情况下取得了具有竞争力的收益。
引用
@article{arxiv.2509.07177,
title = {Towards EnergyGPT: A Large Language Model Specialized for the Energy Sector},
author = {Amal Chebbi and Babajide Kolade},
journal= {arXiv preprint arXiv:2509.07177},
year = {2026}
}
备注
Code and artifacts available at: https://github.com/fitila/energygpt-release