中文

AI 能否掌握施工管理?对 CM 认证考试的 SOTA 大语言模型基准测试

计算与语言 2025-04-15 v1 人工智能

摘要

施工管理(CM)项目日益复杂,伴随着严格的监管要求和劳动力短缺等挑战,需要专门的分析工具来优化项目工作流程和提升绩效。尽管大语言模型(LLM)在一般推理任务中展现出卓越性能,但其在解决 CM 特定挑战(如精确定量分析和监管解释)方面的效果尚未得到充分探索。为填补这一差距,本研究引入 CMExamSet,一个来自四个国家认证 CM 考试的真实多选题基准数据集,包含 689 题。我们的零样本评估测试整体准确率、主题领域(如施工安全)、推理复杂度(单步与多步)以及题型(纯文本、图形参考和表格参考)。结果表明,GPT-4o 和 Claude 3.7 超越了典型的人类通过阈值(70%),分别达到 82% 和 83% 的平均准确率。此外,两者在单步任务上表现更好,准确率分别为 85.7%(GPT-4o)和 86.7%(Claude 3.7)。多步任务更具挑战性,准确率分别降至 76.5% 和 77.6%。此外,两者在图形参考题上表现显著受限,准确率约降至 40%。我们的错误模式分析进一步显示,概念性误解是最常见的错误(分别为 44.4% 和 47.9%),凸显了需要更具领域特异性的推理模型。这些发现凸显了 LLM 作为 CM 宝贵补充分析工具的潜力,同时强调在复杂决策中需要领域特定的改进和持续的人类监督。

关键词

引用

@article{arxiv.2504.08779,
  title  = {Can AI Master Construction Management (CM)? Benchmarking State-of-the-Art Large Language Models on CM Certification Exams},
  author = {Ruoxin Xiong and Yanyu Wang and Suat Gunhan and Yimin Zhu and Charles Berryman},
  journal= {arXiv preprint arXiv:2504.08779},
  year   = {2025}
}