中文

数据集价值:规模定律、Vendi 分数与矩阵谱函数

机器学习 2026-05-29 v1 人工智能 计算机视觉与模式识别 信息论 math.IT

摘要

神经规模定律通过数据集规模评估数据价值,而 Vendi 分数则使用量子熵来衡量数据集价值。我们证明两者都具有子模性。进一步,我们指出 Vendi 分数是更广泛类别的子模块目标的特例,这些目标我们称为矩阵谱函数。这包括行列式 (DPP) 目标以及许多其他目标。我们还引入弱矩阵单调函数,表明它们导致弱子模性矩阵谱函数,为数据评估提供广泛实用目标。我们开发了基于世谱方程的更新方法,避免在贪心优化期间重复特征分解,将 m 维嵌入的边际增益评估相对于 oracle 查询降低 O(m) 因子。这导致平均实证加速约 35,000 倍,使在 ImageNet-1K 比例数据集上直接优化 Vendi 分数变得可行。由此启发,我们比较了几种目标如何预测在固定大小、类别平衡和固定训练预算 regime 下,训练子集对于 held-out 测试性能的价值,包括 Vendi 分数、DPP、设施选址以及三个新的矩阵谱变体。在多个数据集上,设施选址性能最佳。直接优化也揭示了,尽管 Vendi 分数在中等分数范围内具有预测性,但将目标推向更高值时可能使其成为差差的下游性能代理。我们还发现,均匀随机固定大小子集,无论是约束的还是类别平衡的,都在评估分数和 held-out 性能方面表现出极高的集中度。最后,我们表明规模、类别平衡和训练预算 alone 并不能决定数据价值:即使控制这些因素,性能也在从好到坏之间平滑变化。

关键词

引用

@article{arxiv.2605.29448,
  title  = {How Much Is a Dataset Worth? Scaling Laws, the Vendi Score, and Matrix Spectral Functions},
  author = {Jeff A. Bilmes and Gantavya Bhatt and Arnav M. Das},
  journal= {arXiv preprint arXiv:2605.29448},
  year   = {2026}
}

备注

75 pages