利用RLHF实现LLM的稳健不可回答性识别与可信响应生成
计算与语言
2025-07-24 v1
摘要
会话式信息检索(CIR)系统虽然提供了直观的信息访问方式,但面临着一个重大挑战:可靠地处理无法回答的问题,以防止生成误导性或幻觉内容。传统方法通常依赖外部分类器,这可能与核心生成式大语言模型(LLM)产生不一致。本文引入了用于不可回答性的自我感知LLM(SALU),这是一种将不可回答性检测直接深度集成到LLM生成过程中的新方法。SALU采用多任务学习框架进行训练,涵盖标准问答(QA)和针对无法回答查询的显式弃权生成。关键在于,它引入了一个由置信度分数引导的基于人类反馈的强化学习(RLHF)阶段,该阶段显式惩罚幻觉响应并奖励适当的弃权,培养对知识边界的内在自我感知。通过在我们定制的C-IR_Answerability数据集上的大量实验,SALU在正确回答或弃权问题的总体准确率上始终优于强基线,包括混合LLM-分类器系统。人工评估进一步证实了SALU卓越的可靠性,在事实性、适当弃权方面取得高分,且最重要的是,幻觉显著减少,证明了其稳健地“知道何时说‘我不知道’”的能力。
引用
@article{arxiv.2507.16951,
title = {Harnessing RLHF for Robust Unanswerability Recognition and Trustworthy Response Generation in LLMs},
author = {Shuyuan Lin and Lei Duan and Philip Hughes and Yuxuan Sheng},
journal= {arXiv preprint arXiv:2507.16951},
year = {2025}
}