中文

基于不精确监督的标注数据生成

机器学习 2021-06-10 v1

摘要

近期先进的深度学习技术在计算机视觉和自然语言处理等多个领域展现出有前景的结果。深度神经网络在监督学习中的成功严重依赖于大量标注数据。然而,由于标注成本与隐私问题等多种原因,获取带有目标标签的标注数据通常具有挑战性,这给现有深度模型带来困难。尽管如此,获取带有不精确监督(即具有与目标任务相关的标签/标记)的数据相对容易。例如,社交媒体平台充斥着数十亿带有自定标签的帖子和图像,这些并非目标分类任务的精确标签,但通常与目标标签相关。利用这些标签(不精确监督)及其与目标类别的关系来生成标注数据以促进下游分类任务大有前景。然而,相关研究工作相当有限。因此,我们研究了一种基于不精确监督的标注数据生成新问题。我们提出一种名为 ADDES 的新生成框架,可通过从不精确监督数据及不精确监督与目标类之间的关系中学习,为目标分类任务合成高质量标注数据。在图像与文本数据集上的实验结果证明了所提 ADDES 在从不精确监督生成逼真标注数据以促进目标分类任务方面的有效性。

关键词

引用

@article{arxiv.2106.04716,
  title  = {Labeled Data Generation with Inexact Supervision},
  author = {Enyan Dai and Kai Shu and Yiwei Sun and Suhang Wang},
  journal= {arXiv preprint arXiv:2106.04716},
  year   = {2021}
}