中文

GRAIT:基于梯度驱动的拒答感知指令调优框架以有效缓解幻觉

计算与语言 2025-02-11 v1

摘要

拒答感知指令调优 (Refusal-Aware Instruction Tuning, RAIT) 旨在增强大语言模型 (LLM) 的能力,以拒绝其知识范围之外的问题,从而减少幻觉并提高可靠性。有效的 RAIT 必须解决两个关键挑战:首先,有效拒绝未知问题以最小化幻觉;其次,避免过度拒答,以确保可正确回答的问题不会被拒绝,从而维持 LLM 输出的有用性。本文通过从梯度角度出发提出的洞见,构建了 Gradient-driven Refusal Aware Instruction Tuning 框架 GRAIT:(1) 采用梯度驱动的样本选择有效最小化幻觉;(2) 在微调期间引入自适应加权机制,以减少过度拒答的风险,在准确拒答与维持有用回复之间取得平衡。在开放式和多选题问答任务上的实验评估表明,GRAIT 在整体性能上显著优于现有 RAIT 方法。该项目的源代码和数据将在 https://github.com/opendatalab/GRAIT 上公开。

关键词

引用

@article{arxiv.2502.05911,
  title  = {GRAIT: Gradient-Driven Refusal-Aware Instruction Tuning for Effective Hallucination Mitigation},
  author = {Runchuan Zhu and Zinco Jiang and Jiang Wu and Zhipeng Ma and Jiahe Song and Fengshuo Bai and Dahua Lin and Lijun Wu and Conghui He},
  journal= {arXiv preprint arXiv:2502.05911},
  year   = {2025}
}

备注

Equal contribution: Runchuan Zhu, Zinco Jiang, Jiang Wu; Corresponding author: Conghui He