学会信任你的感觉:利用大语言模型的自我意识缓解幻觉
计算与语言
2024-01-30 v1
摘要
我们评估了大语言模型(LLMs)识别和表达其内部知识状态的能力,这是对抗事实性幻觉并确保LLMs可靠应用的关键因素。我们观察到LLMs具有稳健的内部知识状态自我意识,知识探测准确率超过85%证明了这一点。然而,LLMs在生成过程中常常未能表达其内部知识,导致事实性幻觉。我们开发了一个自动化幻觉标注工具Dreamcatcher,它融合了知识探测和一致性检查方法,以对事实偏好数据进行排序。利用知识偏好作为奖励,我们提出了一个基于知识反馈的强化学习(RLKF)训练框架,利用强化学习来增强LLMs的事实性和诚实性。我们在多个模型上的实验表明,RLKF训练有效增强了模型利用其内部知识状态的能力,提升了在多种基于知识和诚实性相关任务中的表现。
引用
@article{arxiv.2401.15449,
title = {Learning to Trust Your Feelings: Leveraging Self-awareness in LLMs for Hallucination Mitigation},
author = {Yuxin Liang and Zhuoyang Song and Hao Wang and Jiaxing Zhang},
journal= {arXiv preprint arXiv:2401.15449},
year = {2024}
}