走在相同的河流里之前先了解其流向:基于确定性表示知识流的拒绝感知指令微调
摘要
拒绝感知指令微调(Refusal-Aware Instruction Tuning, RAIT)使大型语言模型(Large Language Models, LLMs)能够拒绝回答未知问题。通过修改训练数据中未知问题的响应为拒绝响应(如"我不知道"),RAIT增强了LLM的可靠性并减少其幻觉现象。通常情况下,RAIT根据初始LLM响应的正确性来修改训练样本。然而,这种粗略的方法可能导致LLM过度拒绝回答它们本可以正确回答的问题,我们称之为过度拒绝。本文探讨了导致过度拒绝的两个主要原因:静态冲突发生在相似样本位于LLM特征空间内时接收不同的监督信号(原始响应与修改后的"我不知道")。动态冲突是指随着SFT过程中LLM知识的演变,LLM能够回答此前无法回答的问题,但这些可回答的训练样本仍保留来自初始LLM状态的原始"我不知道"监督信号,从而导致不一致。这些冲突导致训练后的LLM将已知问题误分类为未知问题,从而引发过度拒绝。为解决此问题,我们提出了一种基于确定性表示知识流的拒绝感知指令微调方法(Certainty Represented Knowledge Flow for Refusal-Aware Instructions Tuning, 简称CRaFT)。CRaFT的两个主要贡献如下:首先,我们额外引入响应确定性,对数据进行选择性过滤和修改,以减少静态冲突。其次,我们实施初步再训练,以刻画LLM知识状态的变化,从而在微调过程中缓解动态冲突。我们在开放式问答和多选题任务上进行了大量实验。实验结果表明,CRaFT可以在RAIT过程中显著提升LLM的整体性能。代码和数据将在https://github.com/opendatalab/CRaFT发布。
引用
@article{arxiv.2410.06913,
title = {Utilize the Flow before Stepping into the Same River Twice: Certainty Represented Knowledge Flow for Refusal-Aware Instruction Tuning},
author = {Runchuan Zhu and Zhipeng Ma and Jiang Wu and Junyuan Gao and Jiaqi Wang and Dahua Lin and Conghui He},
journal= {arXiv preprint arXiv:2410.06913},
year = {2024}
}
备注
Equal contribution: Runchuan Zhu, Zhipeng Ma, Jiang Wu; Corresponding author: Conghui He