中文

基于市场驱动的预算训练子集选择

机器学习 2025-10-21 v2 人工智能 数值分析 数值分析

摘要

在大规模数据集上训练大型语言模型计算成本高昂,然而实证证据表明,大量训练样本对最终性能的贡献微乎其微。数据子集选择通过在资源约束下识别小型高效子集来解决这一效率问题。然而,样本效用是内在多面的,涵盖不确定性、分布稀有性和多样性信号,这些信号是异构的,通常通过缺乏理论依据的 ad hoc 加权求和方式组合。我们提出一种基于市场的框架,将每个训练样本视为可交易的合同,并采用对数市场评分规则(Logarithmic Market Scoring Rule)将多种效用信号聚合为连贯的价格。异构信号充当交易者,单个流动性参数控制集中度与平滑度,主题级归一化确保聚合的校准。显式处理 token 预算,通过价格-token 决策规则实现,具有可解释的长度偏差参数。我们建立了与最大熵聚合的理论联系,并在噪声但单调的信号下提供了效用恢复保证。在严格 60k token 预算下的 GSM8K 数学推理任务中,我们的选择器在与强单信号基线持平的同时表现出更低的方差,并产生不到 0.1 GPU 小时的开销。在 AGNews 分类任务中以 5-25% 保留率实现,市场公式在准确率上实现竞争力,同时改进了稳定性。我们的框架在固定计算预算下统一了针对提示级别推理和分类任务的多信号数据精选。

关键词

引用

@article{arxiv.2510.02456,
  title  = {Market-Driven Subset Selection for Budgeted Training},
  author = {Ashish Jha and Valentin Leplat and AH Phan},
  journal= {arXiv preprint arXiv:2510.02456},
  year   = {2025}
}

备注

Retitled major revision of the same work (formerly "Market-Based Data Subset Selection -- Principled Aggregation of Multi-Criteria Example Utility"). Abstract and exposition revised; ablations added; theory clarified. Core results unchanged. Supersedes v1; please process as a replacement