基于不确定性的LLM放弃回答提升安全性与减少幻觉
计算与语言
2024-04-18 v1 人工智能
摘要
大型语言模型(LLM)实际部署的一个主要障碍是其缺乏可靠性。在正确性、面对不可回答问题时的幻觉以及安全性这三种情况下,这一问题尤为突出。理想情况下,模型应像人类一样放弃回答——人类凭借理解不确定性的能力,会避免回答自己不知道的问题。受分类任务中类似方法的启发,本研究探索了在问答领域内,LLM在不确定时放弃回答的可行性和有效性。我们研究了两种不确定性:统计不确定性指标和一种独特的言语化度量,称为对话内不确定性(InDU)。结合这些不确定性度量以及有无基于人类反馈的强化学习(RLHF)的模型,我们表明在所有三种情况下,基于正确类型不确定性度量的放弃回答可以提升LLM的可靠性。通过仅牺牲少量高度不确定的样本,我们可以将正确性提高2%至8%,通过正确识别不可回答问题避免50%的幻觉,并将安全性提升70%至99%,且几乎没有额外计算开销。
引用
@article{arxiv.2404.10960,
title = {Uncertainty-Based Abstention in LLMs Improves Safety and Reduces Hallucinations},
author = {Christian Tomani and Kamalika Chaudhuri and Ivan Evtimov and Daniel Cremers and Mark Ibrahim},
journal= {arXiv preprint arXiv:2404.10960},
year = {2024}
}