中文

面向机器学习任务的数据源选择

机器学习 2025-08-04 v2 人工智能 数据库

摘要

数据质量在机器学习(ML)任务的预测性能中起着关键作用——这一挑战在当今组织中数据源爆炸式增长的背景下愈发突出。现有数据发现工作主要集中于元数据匹配、语义相似性或识别用于回答特定查询的表进行联接,但未考虑数据源质量以实现下游 ML 任务的最佳性能。本文聚焦于确定为给定 ML 任务构建底层训练数据集所必需的最佳数据源子集问题。我们提出了 SourceGrasp 和 SourceSplice 框架,以高效选择合适的数据源子集,最大化下游 ML 模型的实用性。两种算法都依赖核心思想:数据源(或其组合)对任务实用性的贡献各不相同,必须慎重选择。 SourceGrasp 采用基于贪婪准则和随机化的元启发式方法;SourceSplice 框架则采用受基因剪接-蛋白合成中核心概念启发的数据源选择机制。我们在三个真实数据集和合成数据集上进行了实证评估,结果表明 SourceSplice 在显著减少子集探索次数的同时,有效识别出数据源子集,实现高任务实用性。我们还报告了 SourceSplice 对多种设置下的决策选择敏感性研究。

关键词

引用

@article{arxiv.2507.22186,
  title  = {SourceSplice: Source Selection for Machine Learning Tasks},
  author = {Ambarish Singh and Romila Pradhan},
  journal= {arXiv preprint arXiv:2507.22186},
  year   = {2025}
}