Dr. Post-Training:LLM 后训练的数据正则化视角
机器学习
2026-05-11 v1 人工智能
摘要
数据选择方法解决了LLM后训练中的一个关键挑战:如何有效地利用稀缺的高保真目标数据与大量但不完美对齐的常规训练数据。本文超越数据选择框架,引入Dr. Post-Training(数据正则化后训练)的新框架,将常规训练数据重新概念化为一种防止过拟合到稀缺目标目标的data-induced regularizer,而非选择数据的池。具体而言,我们提出,在每一步训练中,使用常规训练数据构建一组可行的模型更新方向,然后将稀缺目标数据指定的模型更新方向投影到该可行集上。标准训练和现有数据选择方法均作为不同选择的data-induced regularizer的特殊案例,这些方法对应于在不同正则化强度下的偏差-方差谱系中的不同点。基于此观点,我们提出了一系列方法,提供更丰富的设计空间和更灵活的偏差-方差权衡。对于实际的LLM规模使用,我们引入了谨慎的系统优化,以最小化开销实现这些方法。广泛的实验涵盖SFT、RLHF和RLVR,表明我们的方法在持续优于最先进的数据选择基准,系统基准确认其效率。
引用
@article{arxiv.2605.07063,
title = {Dr. Post-Training: A Data Regularization Perspective on LLM Post-Training},
author = {Pingbang Hu and Xueshen Liu and Z. Morley Mao and Jiaqi W. Ma},
journal= {arXiv preprint arXiv:2605.07063},
year = {2026}
}