中文

基于众包标签的有限教育数据表示学习

机器学习 2020-09-24 v1 人工智能 机器学习

摘要

表示学习已被证明在机器学习模型于众多任务(如机器翻译、人脸识别和推荐)中取得前所未有的成功方面发挥着重要作用。现有大多数表示学习方法通常需要大量一致且无噪声的标签。然而,由于预算限制和隐私顾虑等各种原因,在许多现实场景中标簽非常有限。直接在小型标注数据集上应用标准表示学习方法很容易陷入过拟合问题并导致次优解。更糟糕的是,在教育等一些领域中,有限的标签通常由具有不同专业知识的多名标注者注释,这在众包设置下会产生噪声与不一致性。本文提出一种新颖框架,旨在从带有众包标签的有限数据中学习有效表示。具体而言,我们设计了一种基于分组的深度神经网络,从有限数量的训练样本中学习嵌入,并提出了一种贝叶斯置信度估计器来捕捉众包标签间的不一致性。此外,为加速训练过程,我们开发了一种困难样本选择过程,自适应地挑选出被模型误分类的训练样本。在三个真实世界数据集上进行的广泛实验证明了我们的框架在从带众包标签的有限数据中学习表示方面优于各种最先进(state-of-the-art, SOTA)基线。此外,我们对所提框架的每个主要组件进行了全面分析,并介绍了其在真实生产环境中取得的有前景的结果,以充分理解该框架。

关键词

引用

@article{arxiv.2009.11222,
  title  = {Representation Learning from Limited Educational Data with Crowdsourced Labels},
  author = {Wentao Wang and Guowei Xu and Wenbiao Ding and Gale Yan Huang and Guoliang Li and Jiliang Tang and Zitao Liu},
  journal= {arXiv preprint arXiv:2009.11222},
  year   = {2020}
}

备注

IEEE Transactions on Knowledge and Data Engineering (Accepted)