中文

后训练中的凸数据估值

机器学习 2026-05-19 v1

摘要

改善大语言模型在下游任务上的性能有时需要在后训练期间利用辅助数据集。然而,实际中,开发者面临计算、标注和授权成本的限制,导致无法使用所有可用数据, necessitating 原则性的数据层级选择。这些限制日益受到数据市场的影响,数据获取受预算和谈判的约束。我们将数据估值视为大语言模型后训练中的子集选择问题。我们的目标是在受限预算下识别并加权辅助数据集,以实现目标任务性能的最大化。我们首先指出,常用的梯度对齐得分提供了合理但不完整的估值信号,因为它们忽略了数据集之间的冗余性。为此,我们提出一种基于核均值匹配 (KMM) 的可扩展凸数据层级估值方法,该方法同时考虑目标任务上的对齐性以及辅助数据集之间的冗余性。通过广泛的实验,涵盖多种后训练场景和任务,我们显示我们的方法在各种设置下都一致优于现有估值基准,仅凭低计算开销即可实现更强的性能。我们的结果将数据估值定位为市场受限大语言模型后训练数据选择的实用决策工具。代码已公开于 https://github.com/uiuctml/convex_data_valuation。

关键词

引用

@article{arxiv.2605.16704,
  title  = {Convex Dataset Valuation for Post-Training},
  author = {Siqi Zeng and Christopher Jung and Rui Li and Zhe Kang and Ming Li and Nima Noorshams and Zhigang Wang and Fuchun Peng and Han Zhao and Xue Feng},
  journal= {arXiv preprint arXiv:2605.16704},
  year   = {2026}
}

备注

Published as a conference paper at ICML '26. 30 pages, 8 figures