addressing LLM 不确定性以提升生成式 AI 可靠性
人工智能
2024-11-05 v1
摘要
本文提出了一种受中文酒吧过程启发的动态语义聚类方法,旨在解决大型语言模型(LLM)推理中的不确定性问题。我们通过计算生成语义聚类的熵来量化LLM对给定查询的不确定性。进一步,我们提出利用这些聚类的(负)似然性作为保守预测框架中的(非)合规得分,使模型能够预测一组响应而非单个输出,从而在预测中考虑不确定性。我们在两个著名的问答基准测试COQA和TriviaQA上,对利用Llama2和Mistral的两种LLM,展示了我们不确定性量化(UQ)技术的有效性。我们的做法在UQ方面实现了SOTA性能,评估指标包括AUROC、AUARC和AURAC。我们的方法还显示,与现有SOTA保守预测基线相比,所提出的保守预测器会产生更小的预测集,同时保持相同概率保证,确保正确响应被包含其中。
引用
@article{arxiv.2411.02381,
title = {Addressing Uncertainty in LLMs to Enhance Reliability in Generative AI},
author = {Ramneet Kaur and Colin Samplawski and Adam D. Cobb and Anirban Roy and Brian Matejek and Manoj Acharya and Daniel Elenius and Alexander M. Berenbeim and John A. Pavlik and Nathaniel D. Bastian and Susmit Jha},
journal= {arXiv preprint arXiv:2411.02381},
year = {2024}
}