中文

用于标注风力涡轮机维护日志的大型语言模型比较基准

计算与语言 2026-04-14 v1

摘要

有效的运维(O&M)对于降低风电的平准化能源成本(LCOE)至关重要,然而,涡轮机维护日志的非结构化自由文本性质为自动化分析带来了显著障碍。本文通过提出一个新颖且可复现的框架来解决这一问题,该框架用于对大型语言模型(LLMs)在这些复杂工业记录分类任务上的表现进行基准测试。为促进透明度并鼓励进一步研究,该框架已作为开源工具公开发布。我们系统地评估了一系列最先进的专有和开源 LLMs,对它们在可靠性、运行效率和模型校准方面的权衡进行了基础性评估。我们的结果量化了一个清晰的性能层级,识别出与基准标准高度一致且具有可信、校准良好的置信度分数的顶级模型。我们还证明,分类性能高度依赖于任务的语义模糊性,所有模型在客观组件识别上的一致性高于解释性维护操作。鉴于没有模型能达到完美准确度,且校准情况差异巨大,我们得出结论:最有效且最负责任的近期应用是人机协同系统,其中 LLM 充当强大的助手,为人类专家加速和标准化数据标注,从而提高 O&M 数据质量和下游可靠性分析。

关键词

引用

@article{arxiv.2509.06813,
  title  = {A Comparative Benchmark of Large Language Models for Labelling Wind Turbine Maintenance Logs},
  author = {Max Malyi and Jonathan Shek and Alasdair McDonald and Andre Biscaya},
  journal= {arXiv preprint arXiv:2509.06813},
  year   = {2026}
}

备注

Associated GitHub repository: https://github.com/mvmalyi/wind-farm-maintenance-logs-labelling-with-llms