中文

Slice Tuner:一种用于准确且公平机器学习模型的选择性数据获取框架

机器学习 2021-08-24 v3 机器学习

摘要

随着机器学习在 Software 2.0 时代走向民主化,一个严重的瓶颈是获取足够数据以确保模型的准确与公平。近期包括众包在内的技术提供了具成本效益的数据收集方式。然而,尽可能多地获取数据未必是优化精度与公平性的有效策略。例如,若某在线应用商店对特定数据切片(如美国客户)已有足够训练数据,而对其他切片不足,获取更多美国客户数据只会令模型训练产生偏差。相反,我们认为需要有选择地获取数据,并提出 Slice Tuner,其为每个切片获取可能不同的数据量,以优化所有切片上的模型精度与公平性。该问题与标注已有数据(如主动学习或弱监督中)不同,因为其目标是获取恰当数量的新数据。Slice Tuner 的核心是为各切片维护学习曲线,估计给定更多数据时的模型精度,并利用凸优化寻找最佳数据获取策略。估计学习曲线的关键挑战在于:若数据不足则曲线可能不准确,且切片间可能存在依赖,即获取某切片数据会影响其他切片的学习曲线。我们通过随数据获取迭代且高效地更新学习曲线来解决这些问题。我们使用众包获取数据进行真实数据集上的 Slice Tuner 评估,结果表明即便学习曲线无法可靠估计,Slice Tuner 在模型精度与公平性上也显著优于基线。

关键词

引用

@article{arxiv.2003.04549,
  title  = {Slice Tuner: A Selective Data Acquisition Framework for Accurate and Fair Machine Learning Models},
  author = {Ki Hyun Tae and Steven Euijong Whang},
  journal= {arXiv preprint arXiv:2003.04549},
  year   = {2021}
}

备注

15 pages, 11 figures, 11 tables