超越选择什么:一种用于高效模型训练的即插即用振荡数据量调度方法
机器学习
2026-05-15 v1 人工智能
摘要
数据选择通过识别具有代表性的训练数据同时保持模型性能来加速训练。然而,现有方法主要侧重于设计样本重要性标准,即决定选择什么,而通常在整个训练过程中将所选数据量固定为目标比例。因此,它们在样本身份上通常是动态的,但在数据量上是静态的。在这项工作中,我们从优化角度重新审视数据选择,并表明所选数据训练会产生由瞬时选择比例调节的隐式正则化效应。这揭示了一个关键的权衡:较低的比例会放大选择诱导的正则化,而较高的比例则保留数据覆盖率和优化保真度。受此启发,我们提出了 PODS,一个即插即用振荡数据量调度框架。PODS 并未引入另一种样本评分指标,而是作为一个轻量级模块,在训练过程中动态调度选择多少数据。在目标选择比例下,PODS 在低比例正则化阶段和高比例恢复阶段之间交替,以利用选择诱导的正则化而不牺牲优化稳定性。凭借其轻量级、比例级别和任务无关的设计,PODS 与现有的静态和动态选择方法兼容,并广泛适用于各种训练范式。跨各种数据集、架构和任务的实验表明,PODS 持续改善效率-泛化权衡,例如,在提高准确率的同时将 ImageNet-1k 训练成本降低 50%,并在性能无下降的情况下将 LLM 指令微调加速 2 倍以上。
引用
@article{arxiv.2605.14773,
title = {Beyond What to Select: A Plug-and-play Oscillatory Data-Volume Scheduling for Efficient Model Training},
author = {Suorong Yang and Hanqi Zhu and Hai Gan and Fangjian Su and Guang Li and Furao Shen and Soujanya Poria},
journal= {arXiv preprint arXiv:2605.14773},
year = {2026}
}