中文

NILE:大型语言模型内部一致性对齐

计算与语言 2025-09-23 v2

摘要

作为提升大型语言模型(LLM)与人类意图对齐关键步骤的指令微调(Instruction Fine-Tuning, IFT),其对数据集质量需求极高。然而,现有IFT数据集常包含与LLM在预训练阶段所学习的内部知识不一致的信息,这会显著影响IFT的效果。为解决此问题,本文引入NILE(iNternal consIstency aLignmEnt)框架,旨在优化IFT数据集以发掘LLM的潜能。NILE通过引导目标预训练LLM的内部知识来对应于指令数据。该内部知识被用于修订IFT数据集中的答案。此外,本文提出了一种新颖的内部一致性过滤(Internal Consistency Filtering, ICF)方法,以筛选训练样本,确保其与LLM内部知识高度一致。我们的实验表明,NILE对齐后的IFT数据集可显著提升LLM在多个能力评估数据集上的表现,分别在Arena-Hard上提升最高可达66.6%,在Alpaca-Eval V2上提升68.5%。进一步分析确认,NILE框架的各个组成部分均为这些显著性能提升贡献了重要作用,为数据集与预训练内部知识一致性对于最大化LLM潜能提供了有力证据。

关键词

引用

@article{arxiv.2412.16686,
  title  = {NILE: Internal Consistency Alignment in Large Language Models},
  author = {Minda Hu and Qiyuan Zhang and Yufei Wang and Bowei He and Hongru Wang and Jingyan Zhou and Liangyou Li and Yasheng Wang and Chen Ma and Irwin King},
  journal= {arXiv preprint arXiv:2412.16686},
  year   = {2025}
}

备注

This work has been accepted by EMNLP 2025