面向 LLM 微调数据集的可解释 token 级噪声过滤
计算与语言
2026-04-07 v3 人工智能
摘要
大型语言模型 (LLM) 取得了显著进展,在众多应用中实现了最新成果。微调是适应 LLM 应用于具体下游任务的重要步骤,通常涉及在相应数据集上进行进一步训练。然而,当前微调数据集与 LLM 的 token 级优化机制之间存在根本性差异:大多数数据集在句子层面设计,引入 token 级噪声,导致对最终性能产生负面影响。本文提出了 XTF—a 可解释的 token 级噪声过滤框架。XTF 将 token 级数据对微调过程的复杂且微妙的贡献分解为三个 distinct 且 explicit 属性(reasoning importance, knowledge novelty, 和 task relevance),可通过评分方法进行评估,然后对选定噪声 token 的梯度进行遮蔽,以优化微调后 LLM 的性能。我们在三个具有代表性的下游任务(数学、代码和医疗)上对 7 个主流 LLM 进行了广泛实验。结果表明,XTF 可将下游性能提升最高可达 13.7%。我们的工作凸显了 token 级数据集优化的重要性,并展示了基于属性分解的策略在解释复杂训练机制方面的潜力。
引用
@article{arxiv.2602.14536,
title = {Explainable Token-level Noise Filtering for LLM Fine-tuning Datasets},
author = {Yuchen Yang and Wenze Lin and Enhao Huang and Zhixuan Chu and Hongbin Zhou and Lan Tao and Yiming Li and Zhan Qin and Kui Ren},
journal= {arXiv preprint arXiv:2602.14536},
year = {2026}
}