超越文字:论大语言模型在关键任务风险分析中的可操作性
计算与语言
2024-09-10 v5 人工智能
密码学与安全
人机交互
摘要
背景。风险分析评估特定情景下的潜在风险。风险分析原则是无情境的;相同的方法论可应用于与健康或信息技术安全相关的风险。风险分析需要广泛了解国家和国际法规和标准,并且具有时效性和劳动密集型。大语言模型能够在人类之前更快地总结信息,并且可以针对特定任务进行微调。目标。我们的实证研究旨在调查检索增强生成和微调 LLM 在风险分析中的效果。鉴于目前没有研究探索其在风险分析中的能力。方法。我们手动筛选了 193 个独特情景,涉及来自过去五年中来自工业背景团队存档的 1283 个代表性样本,涵盖超过 50 项关键任务分析。我们将基座 GPT-3.5 和 GPT-4 模型与其检索增强生成和微调版本进行比较。我们雇佣两位人类专家作为模型的竞争者,另外三位人类专家审查模型和前者的分析。审阅者分析了 5000 份情景分析。结果与结论。人类专家表现出更高的准确性,但 LLM 更快更具可操作性。此外,我们的发现表明,RAG 辅助的 LLM 具有最低的幻觉率,能够有效发现隐藏风险,并补充人类专长。因此,模型选择取决于具体需求,FTM 适用于准确性,RAG 适用于隐藏风险发现,基座模型适用于全面性和可操作性。因此,专家可以将 LLM 作为在缩短时间内进行风险分析的有效补充工具。他们还可以通过避免实施不必要措施来节省成本。
引用
@article{arxiv.2406.10273,
title = {Beyond Words: On Large Language Models Actionability in Mission-Critical Risk Analysis},
author = {Matteo Esposito and Francesco Palagiano and Valentina Lenarduzzi and Davide Taibi},
journal= {arXiv preprint arXiv:2406.10273},
year = {2024}
}