中文

建筑安全中的负责任 AI:大语言模型与提示工程的系统评估

人工智能 2024-11-14 v1

摘要

建筑业仍是最危险的行业之一。AI 的最新进展,特别是大语言模型(LLM),为提升工作场所安全提供了广阔机遇。然而,负责任地集成 LLM 需要系统评估,因为在不了解其能力和局限的情况下部署它们,可能产生不准确信息、滋生错误自信并危及工人安全。本研究评估了两个广泛使用的 LLM——GPT-3.5 和 GPT-4o——在注册安全专业人员委员会(BCSP)组织的三项标准化考试中的表现。利用涵盖七大安全知识领域的 385 道题目,研究分析了模型的准确性、一致性和可靠性。结果显示,两个模型均持续超越 BCSP 基准,GPT-4o 准确率达 84.6%,GPT-3.5 达 73.8%。两模型在安全管理体系和危险辨识与控制方面表现优势,但在科学、数学、应急响应和防火方面存在弱项。误差分析指出了影响 LLM 性能的四大主要局限:知识缺乏、推理缺陷、记忆问题和计算错误。研究还凸显了提示工程策略的影响,GPT-3.5 和 GPT-4o 的准确率波动分别高达 13.5% 和 7.9%。然而,没有单一提示配置被证明普遍有效。本研究从三方面推进知识:识别 LLM 可支持安全实践及仍需人工监督的领域;提供通过提示工程改进 LLM 实施的实用见解;为未来研发提供基于证据的方向。这些贡献支持在建筑安全管理中负责任地集成 AI,以实现零伤害目标。

关键词

引用

@article{arxiv.2411.08320,
  title  = {Responsible AI in Construction Safety: Systematic Evaluation of Large Language Models and Prompt Engineering},
  author = {Farouq Sammour and Jia Xu and Xi Wang and Mo Hu and Zhenyu Zhang},
  journal= {arXiv preprint arXiv:2411.08320},
  year   = {2024}
}

备注

29 pages, 5 figures