中文

使用NLP自动化评估LLM生成的击败者质量

软件工程 2026-07-07 v1

摘要

高完整性系统,例如自动驾驶车队和大型能源基础设施,依赖于结构化的保证案例来证明安全声明。为了在不断变化的操作条件下保持有效,必须针对潜在的挑战(称为击败者)检查此类案例。虽然大型语言模型(LLM)可以支持候选击败者的可扩展生成,但评估其质量在很大程度上仍然是手动和主观的过程。本文提出了一种使用自然语言处理技术支持评估LLM生成的击败者的自动化方法。该方法将保证案例图中的结构特征与语义嵌入和基于专家评估的击败者注释训练的元分类器相结合。我们通过汽车和能源领域的两个案例研究来评估该方法。结果显示,人类评审员之间存在显著分歧,Cohen's kappa值低于0.442,突显了一致手动评估的困难。在此背景下,所提出的分类器在验证中实现了平均F1分数0.84,并显示出与个别专家评级的一致性提高。研究结果表明,自动化评估可以帮助减少主观差异,并为保证案例审查提供可扩展的决策支持,同时将最终判断留给领域专家。

关键词

引用

@article{arxiv.2607.06039,
  title  = {Automating Quality Assessment with NLP of LLM-Generated Defeaters},
  author = {Tihomir Rohlinger and Daniel Ratiu and Stefan Wagner},
  journal= {arXiv preprint arXiv:2607.06039},
  year   = {2026}
}

备注

10 pages, 2 figures. Author preprint version of a paper published at ICSRS 2025