AECBench:AEC领域大语言模型知识评估的层次化基准
计算与语言
2026-02-17 v3 人工智能
机器学习
摘要
大语言模型(LLM)作为一种新型信息技术,在建筑、工程与施工(AEC)领域的应用日益广泛。它们已展现出简化建筑全生命周期流程的潜力。然而,在这样一个专业且安全攸关的领域中,LLM的鲁棒性与可靠性仍有待评估。为了应对这一挑战,本文建立了AECBench,这是一个旨在量化当前LLM在AEC领域优势与局限的综合基准。该基准采用五级、面向认知的评估框架(即知识记忆、理解、推理、计算和应用)。基于该框架,定义了23个具有代表性的评估任务。这些任务源自真实的AEC实践,范围涵盖从规范检索到专业文档生成。随后,主要由工程师精心制作了一个包含多种格式(包括开放式问题)的4,800题数据集,并通过了两轮专家评审。此外,引入了“LLM-as-a-Judge”方法,利用专家制定的评分标准,为评估复杂、长篇幅回答提供了一种可扩展且一致的方法。通过对九个LLM的评估,揭示了在五个认知水平上明显的性能下降。尽管模型在知识记忆和理解水平的基础任务上表现出熟练度,但在解释建筑规范表格中的知识、执行复杂推理和计算以及生成领域特定文档方面表现出显著的性能缺陷。因此,本研究为未来旨在将LLM鲁棒且可靠地集成到安全攸关工程实践中的研究与开发奠定了基础。
关键词
引用
@article{arxiv.2509.18776,
title = {AECBench: A Hierarchical Benchmark for Knowledge Evaluation of Large Language Models in the AEC Field},
author = {Chen Liang and Zhaoqi Huang and Haofen Wang and Fu Chai and Chunying Yu and Huanhuan Wei and Zhengjie Liu and Yanpeng Li and Hongjun Wang and Ruifeng Luo and Xianzhong Zhao},
journal= {arXiv preprint arXiv:2509.18776},
year = {2026}
}
备注
Accepted by Advanced Engineering Informatics. Code and data available at: https://github.com/ArchiAI-LAB/AECBench