中文

R-Tuning:指导大语言模型说“我不知道”

计算与语言 2024-06-10 v3

摘要

大语言模型(LLMs)以其令人印象深刻的性能革新了众多领域,但仍面临挑战。一个主要问题是这些模型倾向于生成不存在的事实,这一关切被称为幻觉(hallucination)。我们的研究受如下观察驱动:此前的指令微调(instruction tuning)方法强制模型补全句子,无论其是否知晓相关知识。当问题超出参数化知识范围时,模型会试图编造内容,且无法指示自身缺乏知识。本文中,我们提出一种称为拒绝感知指令微调(Refusal-Aware Instruction Tuning, R-Tuning)的新方法。该方法首先辨识预训练参数所涵盖知识与指令微调数据知识之间的差异,随后基于知识交集构建拒绝感知数据,以微调 LLMs 使其避免回答超出参数化知识的问题。实验结果表明,R-Tuning 有效提升了模型回答已知问题及拒答未知问题的能力。此外,在域外数据集上测试时,拒绝能力被发现是一种可泛化至其他任务的元技能(meta-skill)。进一步分析意外发现,学习不确定性比基于不确定性的测试带来更好的校准能力与更优的不确定性估计能力。我们的代码发布于 https://github.com/shizhediao/R-Tuning。

关键词

引用

@article{arxiv.2311.09677,
  title  = {R-Tuning: Instructing Large Language Models to Say `I Don't Know'},
  author = {Hanning Zhang and Shizhe Diao and Yong Lin and Yi R. Fung and Qing Lian and Xingyao Wang and Yangyi Chen and Heng Ji and Tong Zhang},
  journal= {arXiv preprint arXiv:2311.09677},
  year   = {2024}
}

备注

NAACL 2024