Co-ML:用于培养数据集设计实践的协作式机器学习模型构建
人机交互
2024-01-10 v3
摘要
机器学习(ML)模型从根本上由数据塑造,而构建包容性的 ML 系统需要大量考量如何设计具有代表性的数据集。然而,很少有面向初学者的 ML 建模工具旨在促进对数据集设计实践(包括如何设计数据多样性和检查数据质量)的动手学习。为此,我们概述了一组用于设计包容性 ML 模型的四项数据设计实践(DDPs),并分享了如何设计一个名为 Co-ML 的基于平板的应用,以通过协作式 ML 模型构建体验来培养对 DDPs 的学习。借助 Co-ML,初学者可以通过分布式体验构建图像分类器,其中数据在多个设备间同步,使多个用户能够与同伴讨论和协调中迭代地精炼 ML 数据集。我们在为期两周的 AIML 教育夏令营中部署了 Co-ML,其中 13-18 岁的青少年以小组形式构建定制的 ML 驱动移动应用。我们的分析揭示了在夏令营期间以学生主导项目为背景的 Co-ML 多用户模型构建如何支持 DDPs 的发展,包括纳入数据多样性、评估模型性能和检查数据质量。此外,我们发现学生为提升模型性能而做出的尝试往往将可学习性置于类别平衡之上。通过本工作,我们强调了协作、模型测试接口和学生主导项目的结合如何使学习者能够积极参与探索数据在 ML 系统中的角色。
引用
@article{arxiv.2311.09088,
title = {Co-ML: Collaborative Machine Learning Model Building for Developing Dataset Design Practices},
author = {Tiffany Tseng and Matt J. Davidson and Luis Morales-Navarro and Jennifer King Chen and Victoria Delaney and Mark Leibowitz and Jazbo Beason and R. Benjamin Shapiro},
journal= {arXiv preprint arXiv:2311.09088},
year = {2024}
}