中文

为优质数据而劳碌:理解机器学习从业者在构建优质数据中的困境与诉求

人机交互 2022-11-29 v1

摘要

我们曾以为数据天然存在,但现实并非如此;数据成本高昂、依情境而定且充满两难,持续需要人工干预。随着优质数据对成功机器学习系统至关重要,机器学习界对高质量数据的关注也在同步提升。然而,鲜有研究考察数据集构建者及其为制作优质数据所从事的具体工作与面临的困境。本研究通过对 19 位机器学习专家进行半结构化访谈,呈现了人在数据构建流水线各步骤中实际所做与所考量之事。我们进一步将其困境归为三类主题:1) 现实约束带来的权衡;2) 协调各类数据工作者以保证一致性;3) 处理数据时对人类直觉与默会知识的必要依赖。最后,我们探讨了此类困境之于优质数据为何不可避免,以及从业者的诉求,以期对数据工作提供系统性支持。

关键词

引用

@article{arxiv.2211.14981,
  title  = {The Grind for Good Data: Understanding ML Practitioners' Struggles and Aspirations in Making Good Data},
  author = {Inha Cha and Juhyun Oh and Cheul Young Park and Jiyoon Han and Hwalsuk Lee},
  journal= {arXiv preprint arXiv:2211.14981},
  year   = {2022}
}