中文

MYCROFT:面向有效与高效的外部数据增强

机器学习 2024-10-14 v1

摘要

机器学习(ML)模型通常需要大量数据才能发挥良好性能。当可用数据有限时,模型训练者可能需要从外部来源获取更多数据。常常情况下,宝贵的数据由持有数据的私营实体拥有,由于知识产权和隐私 concerns,这些实体对分享数据持保留态度。这使得模型训练者获取所需数据以改善模型性能变得具有挑战性和高昂成本。为解决这一挑战,我们提出了一种名为 Mycroft 的数据高效方法,使模型训练者能够在受限的数据共享预算下评估不同数据来源的相对实用性。通过利用特征空间距离和梯度匹配,Mycroft 从每个数据拥有者那里识别出小而富有信息的数据子集,使模型训练者能够以最小的数据暴露实现性能最大化。跨四个任务、两个领域的实验结果表明,Mycroft 能快速收敛至与共享全部数据(即全信息基线)相同的性能。此外,Mycroft 对噪声具有鲁棒性,并且能有效地按实用性对数据拥有者进行排序。Mycroft 为实现高性能 ML 模型的民主化训练铺平了道路。

关键词

引用

@article{arxiv.2410.08432,
  title  = {MYCROFT: Towards Effective and Efficient External Data Augmentation},
  author = {Zain Sarwar and Van Tran and Arjun Nitin Bhagoji and Nick Feamster and Ben Y. Zhao and Supriyo Chakraborty},
  journal= {arXiv preprint arXiv:2410.08432},
  year   = {2024}
}

备注

10 pages, 3 figures, 3 tables