指令与推理数据如何塑造后训练:基于逐层梯度视角的数据质量分析
机器学习
2026-05-12 v2 人工智能
计算与语言
摘要
随着大语言模型(LLM)的后训练从指令遵循推进到复杂推理任务,理解不同数据如何影响微调动力学在很大程度上仍未被探索。在本文中,我们对由低/高质量指令和推理数据为 LLM 后训练诱导的逐层梯度进行了谱分析。我们的分析表明,广泛研究的数据评估指标(例如 IFD、InsTag、Difficulty 和 Reward)可以通过从梯度的奇异值分解(SVD)计算出的谱特性来解释和统一。具体而言,更高质量的数据通常与更低的核范数和更高的有效秩相关。值得注意的是,有效秩在捕捉细微的质量差异方面表现出比核范数更好的鲁棒性和分辨率。例如,推理数据比指令数据获得显著更高的有效秩,暗示在更复杂的任务上具有更丰富的梯度结构。我们的实验还强调,同一家族内的模型无论其大小如何都共享相似的梯度模式,而不同模型家族之间则存在显著差异。这项工作提供了关于数据质量在指令和推理数据中影响的统一视角,阐明了数据质量与训练稳定性之间的相互作用,为开发更好的后训练数据探索策略提供了新见解。
引用
@article{arxiv.2504.10766,
title = {How Instruction and Reasoning Data shape Post-Training: Data Quality through the Lens of Layer-wise Gradients},
author = {Ming Li and Yanhong Li and Ziyue Li and Tianyi Zhou},
journal= {arXiv preprint arXiv:2504.10766},
year = {2026}
}
备注
ACL2026, camera-ready