中文

基于下游反馈的值驱动预训练

机器学习 2026-01-30 v1 人工智能

摘要

少量的验证目标信息能否引导基础模型昂贵的无监督预训练?标准预训练优化固定的代理目标(如下一个标记预测),可能在计算资源分配上偏离感兴趣的下游能力。我们提出V-Pretraining:一种价值驱动、模块无关的方法,用于受控继续预训练,其中轻量级任务设计者重新塑造预训练任务,以最大化每个梯度步骤的价值。例如,考虑带样本增强的自监督学习(SSL)。V-Pretraining任务设计者为使预训练损失梯度与在下游任务(如图像分割)上计算的梯度对齐的预训练任务(如增强方法)进行选择。这有助于将预训练引导至相关的下游能力。值得注意的是,预训练的模型从未在下游任务标签上更新;这些标签仅用于塑造预训练任务。在匹配的学习者更新预算下,V-Pretraining对0.5B至7B规模的语言模型在推理(GSM8K测试Pass@1)方面提升了最高可达18%,仅使用12%的GSM8K训练示例作为反馈。在视觉SSL中,我们在ADE20K上实现了最高提升1.07 mIoU,同时降低NYUv2的RMSE,提高ImageNet线性准确率,并提供了在继续预训练中改进标记效率的初步证据。

关键词

引用

@article{arxiv.2601.22108,
  title  = {Value-Based Pre-Training with Downstream Feedback},
  author = {Shuqi Ke and Giulia Fanti},
  journal= {arXiv preprint arXiv:2601.22108},
  year   = {2026}
}