AutoMixer:基于检查点数据混合器
计算与语言
2026-02-10 v3
摘要
在语言模型训练中,期望模型具备来自各种任务的能力。然而,如何直接获取这些能力所需的数据混合方案尚不明确,因为数据与任务之间的关系难以建模。本文我们观察到,检查点模型在训练轨迹的不同点上展现出新兴的能力。训练过程中保存的检查点往往作为数据信号的未被充分利用的来源。我们基于模型在基准测试中的各自能力识别这些数据模型,并通过其对源数据聚合的一阶影响近似将其用作数据混合器。我们在八个推理基准测试中展示了该框架在预训练设置下的显著改进,性能提升最高可达1.93%。总体而言,这表明了检查点模型在提升数据质量和优化数据混合方面的潜力。
引用
@article{arxiv.2506.21910,
title = {AutoMixer: Checkpoint Artifacts as Automatic Data Mixers},
author = {Ernie Chang and Yang Li and Patrick Huber and Vish Vogeti and David Kant and Yangyang Shi and Vikas Chandra},
journal= {arXiv preprint arXiv:2506.21910},
year = {2026}
}
备注
Accepted at ACL 2025