中文

多样化集成:众包机器学习的一次实验

机器学习 2024-02-19 v1 计算机与社会 人机交互

摘要

在 Kaggle 等竞赛平台上,众包机器学习是一种流行且往往有效的生成高精度模型的方法。通常,团队会竞相追求在保留集上整体误差最小的最准确模型,而在此类竞赛接近尾声时,排行榜顶部的团队常在平台机制之外对其模型进行集成或平均,以获得最终的全局最优模型。在 arXiv:2201.10408 中,作者在公平机器学习的背景下开发了一种替代性的众包框架,旨在当存在且可识别子群不公平时,将社区反馈整合到模型中。在那里,与经典的众包机器学习不同,参与者通过致力于子问题(例如服务于公平性的人口统计子群)而刻意专业化其工作。在此,我们对这项工作采取更广阔的视角:我们指出,在该框架内,参与者既可以为了公平性而专业化,也可以仅仅为了迎合其特定专长(例如,在图像分类任务中专注于识别鸟类物种)。与传统众包不同,这允许参与者努力的多样化,并可能为更广泛的个体提供参与机制(例如,对特定公平性问题有见解的机器学习新手)。我们提出了对该框架的首次中等规模实验评估,共有 46 个参与团队尝试构建模型以根据美国社区调查数据预测收入。我们提供了对团队方法的实证分析,并讨论了我们开发的新型系统架构。在此基础上,我们就如何最佳部署此类框架提供了具体指导。

关键词

引用

@article{arxiv.2402.10795,
  title  = {Diversified Ensembling: An Experiment in Crowdsourced Machine Learning},
  author = {Ira Globus-Harris and Declan Harrison and Michael Kearns and Pietro Perona and Aaron Roth},
  journal= {arXiv preprint arXiv:2402.10795},
  year   = {2024}
}