中文

面向大语言模型的认识谦逊诱导:面向减少幻觉的目标化监督微调方法

计算与语言 2026-03-19 v1

摘要

大型语言模型 (LLM) 常常会产生幻觉,生成流畅但错误的信息,这部分原因是由于监督式微调 (SFT) 隐式地奖励总是回应。我们引入 HypoTermInstruct\textit{HypoTermInstruct},一个为 11,151 个问题生成 31,487 个回应的 SFT 数据集,旨在教会模型认识谦逊——即识别自身知识局限并承认不确定性的能力。这通过关于非存在的“假设”术语的问题来实现。我们也发布了 HypoTermQA-Enhanced\textit{HypoTermQA-Enhanced},一个通过多重验证强化的幻觉倾向基准。我们进行了 800 次受控 LoRA SFT 实验,覆盖 Llama3.1-8B\textit{Llama3.1-8B}Gemma3-4B\textit{Gemma3-4B}(基础版和指令版),测试了 100 个微调配置并配对对照。我们的结果表明,用 HypoTermInstruct\textit{HypoTermInstruct} 替换通用指令数据显著提高了 HypoTerm Score(中位数提升 0.19% 至 25.91%)和 FactScore(提升 +0.39% 至 +0.86%),同时保持 MMLU 上的稳定性能(最小下降 0.26% 至 0.35%)。我们的工作表明,针对性且高质量的 SFT 数据在不采用首选/RL 流程的情况下,有效地减少了幻觉,提供了机理性见解并通向更可靠的 AI 系统的实用路径。

关键词

引用

@article{arxiv.2603.17504,
  title  = {Inducing Epistemological Humility in Large Language Models: A Targeted SFT Approach to Reducing Hallucination},
  author = {Cem Uluoglakci and Tugba Taskaya Temizel},
  journal= {arXiv preprint arXiv:2603.17504},
  year   = {2026}
}