中文

面向大语言模型指令调优的数据选择的神经元感知方法

计算与语言 2026-03-16 v1

摘要

指令调优 (IT) 已被证明是一种有效的方法,可释放大语言模型 (LLM) 的强大能力。近期研究表明,过多的 IT 数据会降低 LLM 的性能,而精心挑选少量高质量的 IT 数据子集可显著提升其能力。因此,从 IT 数据集中识别最高效子集数据,以有效开发 LLM 的特定或通用能力,已成为关键挑战。为此,我们提出一种新型且高效的框架,称为 NAIT。NAIT 通过分析 IT 数据与目标域能力之间神经元激活模式的相似性来评估 IT 数据对 LLM 性能的影响。具体而言,NAIT 从目标域能力的领域内数据集中捕获神经元激活模式,以构建可重用且可迁移的神经元激活特征。然后根据候选样本与目标能力预期激活特征的相似性进行评估和选择。实验结果表明,使用 NAIT 选取的 10% Alpaca-GPT4 IT 数据子集在各种任务上均一致优于依赖外部先进模型或基于不确定性特征的方法。我们的发现还揭示了神经元激活特征在 LLM 不同能力之间具有迁移性。特别是,具有更多逻辑推理和程序化特征的 IT 数据具有强大的通用迁移性,使模型在多个任务上都能发展出更强的能力,而一小部分稳定的核心数据子集足以一致激活基本模型能力,并在 diverse 任务上普遍性地提升性能。

关键词

引用

@article{arxiv.2603.13201,
  title  = {Neuron-Aware Data Selection In Instruction Tuning For Large Language Models},
  author = {Xin Chen and Junchao Wu and Shu Yang and Runzhe Zhan and Zeyu Wu and Min Yang and Shujian Huang and Lidia S. Chao and Derek F. Wong},
  journal= {arXiv preprint arXiv:2603.13201},
  year   = {2026}
}