中文

BLISS:面向语言模型预训练的数据选择的轻量级双层影响评分方法

机器学习 2026-02-04 v3

摘要

有效的数据选择对于预训练大型语言模型 (LLM) 至关重要,可以提高效率并改进对下游任务的泛化。然而,现有的做法通常需要依赖外部预训练模型,这使得难以将数据选择的效应与外部预训练模型的效应区分开来。此外,这些方法往往忽视了如果模型训练到收敛,所选数据的长期影响,主要是由于全规模 LLM 预训练的昂贵成本。本文我们引入 BLISS(\textbf{B}ileve\textbf{L} \textbf{I}nfluence \textbf{S}coring method for data \textbf{S}election):一种完全从头开始运行的轻量级数据选择方法,不依赖任何外部预训练的 oracle 模型,同时显式地考虑所选数据的长期影响。BLISS 利用小型代理模型作为 LLM 的替代品,并采用评分模型来估计如果代理模型训练到收敛,训练样本的长期影响。我们将数据选择建模为双层优化问题,其中上层目标优化评分模型以为训练样本分配重要性权重,以确保最小化下层目标(即对加权训练损失训练代理模型直至收敛)导致最佳验证性能。一旦优化完成,训练好的评分模型即可预测数据集中的影响分数,从而高效选择 LLM 预训练的高质量样本。我们通过在 C4 数据集的选中子集上预训练 410M/1B/2.8B Pythia 和 LLaMA-0.5B 模型来验证 BLISS。值得注意的是,在 1B 模型设置下,BLISS 在达到与最先进方法相同性能方面实现了 1.7×1.7\times 的加速,显示出在多个下游任务中表现出色的性能。

关键词

引用

@article{arxiv.2510.06048,
  title  = {BLISS: A Lightweight Bilevel Influence Scoring Method for Data Selection in Language Model Pretraining},
  author = {Jie Hao and Rui Yu and Wei Zhang and Huixia Wang and Jie Xu and Mingrui Liu},
  journal= {arXiv preprint arXiv:2510.06048},
  year   = {2026}
}