中文

LLM微调的数据估值:基于语言模型算术的高效Shapley值近似

机器学习 2026-01-27 v2 计算机科学与博弈论 机器学习

摘要

数据是训练大型语言模型(LLMs)的关键资产,与计算资源和专业人才并列。虽然部分训练数据公开可用,但生成专有数据集(如人类偏好标注或从现有资源精选新数据集)需要巨额投入。由于更大的数据集通常能提升模型性能,两个自然问题随之而来。首先,数据所有者如何做出明智的 curated 策略和数据来源投资决策?其次,多个数据所有者如何在公平分配收益的同时合作训练更优模型?这一问题——数据估值——不仅限于大型语言模型,机器学习社会通过合作博弈论视角已有所解决,其中Shapley值是主流解决方案。然而,计算Shapley值在数据估值中极其昂贵,通常需要大量模型重新训练,对大型机器学习模型而言不可行。本文展示了针对使用直接偏好优化(DPO)训练的LLMs,计算这一挑战的计算方式被显著简化。我们表明,DPO的特定数学结构实现了可扩展的Shapley值计算。我们认为这一观察为数据估值与大型语言模型的众多应用打开了可能性。

关键词

引用

@article{arxiv.2512.15765,
  title  = {Data Valuation for LLM Fine-Tuning: Efficient Shapley Value Approximation via Language Model Arithmetic},
  author = {Mélissa Tamine and Otmane Sakhi and Benjamin Heymann},
  journal= {arXiv preprint arXiv:2512.15765},
  year   = {2026}
}

备注

11 pages, 2 figures