中文

关于极端多标签分类的数据增强

计算与语言 2020-09-24 v1 人工智能 信息检索 机器学习

摘要

在本文中,我们关注极端多标签分类(XMC)问题的数据增强。XMC最具挑战性的问题之一是长尾标签分布,即便强模型也受困于监督不足。为缓解此类标签偏置,我们提出了一种简单而有效的增强框架以及一种新的最先进分类器。我们的增强框架利用预训练的GPT-2模型生成输入文本的标签不变扰动以扩充现有训练数据。由此,相较基线模型取得了显著提升。我们的贡献有两方面:(1)我们引入了一种新的最先进分类器,其使用带RoBERTa的标签注意力,并将其与我们的增强框架结合以进一步提升效果;(2)我们广泛研究了不同增强方法在XMC任务中的有效性。

关键词

引用

@article{arxiv.2009.10778,
  title  = {On Data Augmentation for Extreme Multi-label Classification},
  author = {Danqing Zhang and Tao Li and Haiyang Zhang and Bing Yin},
  journal= {arXiv preprint arXiv:2009.10778},
  year   = {2020}
}