中文

DataS^3:针对专业化的 Dataset Subset Selection

机器学习 2025-04-24 v1 人工智能

摘要

在许多实际机器学习 (ML) 应用中(例如检测 x 光片中的断裂骨骼、检测相机陷阱中的物种),模型需要在特定部署(例如特定医院、特定国家公园)中表现良好,而非在更广泛的领域。然而,部署往往具有不平衡、独特的数据分布。训练分布与部署分布之间的差异可能导致次优性能,这凸显了从可用训练数据中选择部署专用子集的必要性。我们正式化了针对专业化的 dataset subset selection (DS3):给定从一般分布中抽取的训练集和从所需部署特定分布中抽取的(可能无标签)查询集,目标是选择一个优化部署性能的训练数据的子集。我们引入 DataS^3;第一个专为 DS3 问题设计的数据集和基准。DataS^3 涵盖了多样的现实应用领域,每个领域都有一个针对特定部署进行专业化的子集。我们对来自 various 家族的算法——包括 coresets、数据过滤和数据 curation——在 DataS^3 上的 comprehensive study,发现 general-distribution 方法在部署特定任务上 consistently 失败。此外,我们展示了手动精选(部署特定)expert 子集的存在,这些子集在训练所有可用数据时表现更好,准确率提升最高可达 51.3 percent。我们的基准凸显了在部署特定分布上实现性能和训练效率的关键作用,这一点我们认为将随着 global public datasets 在各领域变得更广泛以及 ML 模型在现实世界中部署而变得更加重要。

关键词

引用

@article{arxiv.2504.16277,
  title  = {DataS^3: Dataset Subset Selection for Specialization},
  author = {Neha Hulkund and Alaa Maalouf and Levi Cai and Daniel Yang and Tsun-Hsuan Wang and Abigail O'Neil and Timm Haucke and Sandeep Mukherjee and Vikram Ramaswamy and Judy Hansen Shen and Gabriel Tseng and Mike Walmsley and Daniela Rus and Ken Goldberg and Hannah Kerner and Irene Chen and Yogesh Girdhar and Sara Beery},
  journal= {arXiv preprint arXiv:2504.16277},
  year   = {2025}
}