中文

CAMB:面向民航维修的综合性工业级 LLM 基准

计算与语言 2025-08-29 v1

摘要

民航维修是一个遵循严格行业标准的领域。在该领域,维修程序和故障排查是关键任务,需要复杂的推理能力。为弥补当前缺乏针对民航维修领域的大型语言模型(LLM)评估工具的不足,我们提出并开发了一个专为民航维修设计的工业级基准测试。该基准测试具有双重目的:提供标准化工具来衡量民航维修中LLM的能力,识别领域知识和复杂推理方面的具体缺陷;通过确定这些缺陷,为有针对性的改进工作(如领域特定微调、RAG优化或专业提示工程)奠定基础,从而促进民航维修中更智能解决方案的发展。我们的工作填补了当前LLM评估主要聚焦于数学和编码推理任务的空白。此外,鉴于检索增强生成(RAG)系统是实际应用中主流的解决方案,我们利用该基准评估现有著名向量嵌入模型和LLM在民航维修场景中的表现。通过实验探索与分析,我们证明了该基准在评估该领域模型性能方面的有效性,并开源此评估基准和代码以促进进一步的研究与开发:https://github.com/CamBenchmark/cambenchmark

关键词

引用

@article{arxiv.2508.20420,
  title  = {CAMB: A comprehensive industrial LLM benchmark on civil aviation maintenance},
  author = {Feng Zhang and Chengjie Pang and Yuehan Zhang and Chenyu Luo},
  journal= {arXiv preprint arXiv:2508.20420},
  year   = {2025}
}