PACE-LM:在云故障根因分析中使用GPT-4进行校准置信度估计的提示与增强方法
计算与语言
2023-10-02 v3 人工智能
机器学习
软件工程
摘要
主流云服务提供商已采用基于先进 AI 的解决方案(如大型语言模型)来辅助人类识别云故障的根因。尽管 AI 驱动的助手在根因分析流程中日益普及,但其辅助值班工程师的有效性受限于低准确率,这源于任务固有的难度、基于 LLM 的方法容易产生幻觉,以及难以区分这些伪装良好的幻觉。为应对该挑战,我们提出对预测进行置信度估计,以帮助值班工程师决定是否采纳模型预测。考虑到许多基于 LLM 的根因预测器的黑盒性质,微调或基于温度缩放的方法并不适用。因此我们设计了一种创新的置信度估计框架,基于提示检索增强大型语言模型(LLMs),仅需根因预测器极少的信息量。该方法包含两个评分阶段:基于 LLM 的置信度估计器首先评估其在面对当前故障时的判断置信度(反映其在参考数据中的“有据性”水平),随后基于历史参考对根因预测进行评级。一个优化步骤将这两类分数结合以得到最终置信度赋值。我们展示了我们的方法能够为预测的根因生成校准的置信度估计,验证了检索历史数据与提示策略的实用性,以及跨不同根因预测模型的泛化能力。我们的研究朝着可靠且有效地将 LLMs 嵌入云故障管理系统迈出了重要一步。
引用
@article{arxiv.2309.05833,
title = {PACE-LM: Prompting and Augmentation for Calibrated Confidence Estimation with GPT-4 in Cloud Incident Root Cause Analysis},
author = {Dylan Zhang and Xuchao Zhang and Chetan Bansal and Pedro Las-Casas and Rodrigo Fonseca and Saravan Rajmohan},
journal= {arXiv preprint arXiv:2309.05833},
year = {2023}
}