中文

模型知道什么、知道得如何:用于学习何时说"我不知道"的知识加权微调

计算与语言 2026-04-08 v1 人工智能

摘要

虽然大语言模型(LLMs)在多样化的用户查询中展现出强大的能力,但它们仍然遭受幻觉的困扰,这通常源于预训练与微调之间的知识不对齐。为了解决这种不对齐,我们通过多采样推理可靠地估计细粒度的、实例级别的知识分数。利用知识分数,我们根据模型已有的知识缩放学习信号,同时鼓励对超出范围的查询明确表达"我不知道"的回答。实验结果表明,这种方法使模型在缺乏知识时能够明确表达不确定性,同时在它能回答的问题上保持准确性。此外,我们提出了不确定性的评估指标,表明在已知和未知实例之间的准确区分能够持续提升性能。

关键词

引用

@article{arxiv.2604.05779,
  title  = {What Models Know, How Well They Know It: Knowledge-Weighted Fine-Tuning for Learning When to Say "I Don't Know"},
  author = {Joosung Lee and Hwiyeol Jo and Donghyeon Ko and Kyubyung Chae and Cheonbok Park and Jeonghoon Kim},
  journal= {arXiv preprint arXiv:2604.05779},
  year   = {2026}
}

备注

8 pages