中文

基于 LLM 的 HSE 合规性评估:基准、性能与进展

计算与语言 2025-05-30 v1

摘要

健康、安全与环境 (HSE) 合规性评估要求在复杂的法规和复杂的人-机-环境交互下进行动态实时决策。尽管大型语言模型 (LLM) 在决策智能和上下文对话方面具有巨大潜力,但其在 HSE 领域特定知识和结构化法律推理方面的能力仍有待探索。我们引入了 HSE-Bench,这是第一个旨在评估 LLM 的 HSE 合规性评估能力的基准数据集。HSE-Bench 包含超过 1,000 道从法规、法院案例、安全考试和现场视频中提取的人工标注问题,并集成了基于问题识别、规则回忆、规则应用和规则结论 (IRAC) 的推理流程,以评估整体推理管线。我们对不同的提示策略和超过 10 个 LLM 进行了广泛评估,包括基础模型、推理模型和多模态视觉模型。结果表明,尽管当前 LLM 取得了良好的性能,但其能力在很大程度上依赖于语义匹配,而非基于底层 HSE 合规性语境的原则性推理。此外,其原生推理轨迹缺乏严格 HSE 合规性评估所需的系统性法律推理。为缓解这些问题,我们提出了一种新的提示技术——专家推理,该技术引导 LLM 模拟不同专家的推理过程进行合规性评估,并达成更准确的统一决策。我们希望我们的研究突显 LLM 在 HSE 合规性方面的推理差距,并激发对相关任务的进一步研究。

关键词

引用

@article{arxiv.2505.22959,
  title  = {LLM-based HSE Compliance Assessment: Benchmark, Performance, and Advancements},
  author = {Jianwei Wang and Mengqi Wang and Yinsi Zhou and Zhenchang Xing and Qing Liu and Xiwei Xu and Wenjie Zhang and Liming Zhu},
  journal= {arXiv preprint arXiv:2505.22959},
  year   = {2025}
}