中文

面向航空制造专业知识的大语言模型评估:自动生成与多模型问答

计算与语言 2025-02-04 v2 人工智能

摘要

航空制造对技术参数要求极高。大型语言模型 (LLM) 如 GPT-4 与 QWen 在自然语言处理方面的卓越表现催生了其在过程设计、材料选择及工具信息检索等任务中的行业应用前景。然而,LLM 在专业领域易产生“幻觉”,生成不准确或错误信息,这对航空产品质量及飞行安全构成重大风险。本文提出一套针对航空制造领域 LLM 的评估指标体系,通过分析其回答基于专业知识问题的表现来衡量准确性。首先,通过深入分析经典航空制造教科书与指南,提取关键信息。随后,利用 LLM 生成技术构建难度各异、多正确答案的多选题。随后,采用不同 LLM 模型作答并记录准确率。实验结果表明,LLM 在航空专业知识方面的能力亟需提升。本研究为航空制造中 LLM 的应用提供了理论基础与实践指导,填补了该领域的关键空白。

关键词

引用

@article{arxiv.2501.17183,
  title  = {LLM Evaluation Based on Aerospace Manufacturing Expertise: Automated Generation and Multi-Model Question Answering},
  author = {Beiming Liu and Zhizhuo Cui and Siteng Hu and Xiaohua Li and Haifeng Lin and Zhengxin Zhang},
  journal= {arXiv preprint arXiv:2501.17183},
  year   = {2025}
}

备注

conference paper