数据即杠杆:基于邻近数据集的预测多样性
机器学习
2026-02-03 v2
摘要
预测多样性(即存在等效且竞争的多个优质模型)近年来受到广泛关注。虽然先前工作强调建模选择的重要性,但数据在塑造多样性方面发挥的关键作用却被大大低估。在本工作中,我们首先引入邻近数据集框架,认为大量数据处理可被重新表述为在邻近数据集之间进行选择。在该框架下,我们发现一种反直觉的理论关系:在类别分布重叠更大的邻近数据集之间 exhibit 较低的多样性。基于这一洞察,我们将该框架应用于两个领域:主动学习和数据插值。对于每个领域,我们建立了邻近数据集视角的自然扩展,开展了对现有算法在多样性方面的首次系统性研究,并提出了两种新颖的多样性感知方法,即针对主动学习的多样性感知数据获取策略和针对数据插值的多样性感知插值方法。
引用
@article{arxiv.2510.21303,
title = {Data as a Lever: A Neighbouring Datasets Perspective on Predictive Multiplicity},
author = {Prakhar Ganesh and Hsiang Hsu and Golnoosh Farnadi},
journal= {arXiv preprint arXiv:2510.21303},
year = {2026}
}