中文

从用户生成数据学习的一个陷阱:主观类问题的深入分析

机器学习 2020-03-25 v1 机器学习

摘要

监督学习算法领域的研究隐含地假设训练数据由领域专家或至少可通过 Amazon Mechanical Turk 等众包服务获得的半专业标注者进行标注。随着互联网的出现,数据变得丰富,大量基于机器学习的系统开始使用用户生成数据进行训练,并将分类数据作为真实标签。然而,在用户定义标签的监督学习领域,用户未必是专家且可能出于提升自身系统效用的动机提供错误标签,这方面的工作甚少。本文中,我们提出用户定义标签中的两类:主观类与客观类——表明客观类与领域专家提供的标签同样可靠,而主观类则易受用户偏见与操纵。我们将此定义为主观类问题,并提供一个无需查询 oracle 即可检测数据集中主观标签的框架。利用该框架,数据挖掘从业者可在项目早期检测主观类,避免用传统机器学习技术处理主观类问题而浪费宝贵时间与资源。

关键词

引用

@article{arxiv.2003.10621,
  title  = {A Pitfall of Learning from User-generated Data: In-depth Analysis of Subjective Class Problem},
  author = {Kei Nemoto and Shweta Jain},
  journal= {arXiv preprint arXiv:2003.10621},
  year   = {2020}
}

备注

Under review by ECML PKDD 2020