面向长尾多标签文本分类的成对实例关系增强
计算与语言
2022-11-22 v1
摘要
多标签文本分类(MLTC)是自然语言处理的关键任务之一,旨在为单篇文档分配多个目标标签。由于标签热度不均,多数情况下每标签的文档数呈长尾分布。为数据稀缺的尾部标签学习分类器远比数据丰富的头部标签困难,主因是头部标签通常具备充足信息(如较大的类内多样性)而尾部标签不具备。为此,我们提出成对实例关系增强网络(PIRAN)以增强尾部标签文档,平衡尾、头标签。PIRAN 由关系收集器与实例生成器组成:前者从头部标签抽取文档成对关系;后者以这些关系为扰动,在高层特征空间围绕有限的给定尾部标签实例生成新文档实例。同时设计两种正则器(多样性与一致性)约束生成过程。一致性正则器促使尾部标签方差接近头部标签,进一步平衡整体数据集;多样性正则器确保生成实例具多样性并避免冗余。三个基准数据集上的大量实验表明,PIRAN 持续优于 SOTA 方法,并显著提升尾部标签性能。
引用
@article{arxiv.2211.10685,
title = {Pairwise Instance Relation Augmentation for Long-tailed Multi-label Text Classification},
author = {Lin Xiao and Pengyu Xu and Liping Jing and Xiangliang Zhang},
journal= {arXiv preprint arXiv:2211.10685},
year = {2022}
}