关于极端多标签分类的数据增强
计算与语言
2020-09-24 v1 人工智能
信息检索
机器学习
摘要
在本文中,我们关注极端多标签分类(XMC)问题的数据增强。XMC最具挑战性的问题之一是长尾标签分布,即便强模型也受困于监督不足。为缓解此类标签偏置,我们提出了一种简单而有效的增强框架以及一种新的最先进分类器。我们的增强框架利用预训练的GPT-2模型生成输入文本的标签不变扰动以扩充现有训练数据。由此,相较基线模型取得了显著提升。我们的贡献有两方面:(1)我们引入了一种新的最先进分类器,其使用带RoBERTa的标签注意力,并将其与我们的增强框架结合以进一步提升效果;(2)我们广泛研究了不同增强方法在XMC任务中的有效性。
引用
@article{arxiv.2009.10778,
title = {On Data Augmentation for Extreme Multi-label Classification},
author = {Danqing Zhang and Tao Li and Haiyang Zhang and Bing Yin},
journal= {arXiv preprint arXiv:2009.10778},
year = {2020}
}