面向大语言模型的认识谦逊诱导:面向减少幻觉的目标化监督微调方法
计算与语言
2026-03-19 v1
摘要
大型语言模型 (LLM) 常常会产生幻觉,生成流畅但错误的信息,这部分原因是由于监督式微调 (SFT) 隐式地奖励总是回应。我们引入 ,一个为 11,151 个问题生成 31,487 个回应的 SFT 数据集,旨在教会模型认识谦逊——即识别自身知识局限并承认不确定性的能力。这通过关于非存在的“假设”术语的问题来实现。我们也发布了 ,一个通过多重验证强化的幻觉倾向基准。我们进行了 800 次受控 LoRA SFT 实验,覆盖 和 (基础版和指令版),测试了 100 个微调配置并配对对照。我们的结果表明,用 替换通用指令数据显著提高了 HypoTerm Score(中位数提升 0.19% 至 25.91%)和 FactScore(提升 +0.39% 至 +0.86%),同时保持 MMLU 上的稳定性能(最小下降 0.26% 至 0.35%)。我们的工作表明,针对性且高质量的 SFT 数据在不采用首选/RL 流程的情况下,有效地减少了幻觉,提供了机理性见解并通向更可靠的 AI 系统的实用路径。
引用
@article{arxiv.2603.17504,
title = {Inducing Epistemological Humility in Large Language Models: A Targeted SFT Approach to Reducing Hallucination},
author = {Cem Uluoglakci and Tugba Taskaya Temizel},
journal= {arXiv preprint arXiv:2603.17504},
year = {2026}
}