中文

探索对比学习在长尾多标签文本分类中的应用

机器学习 2024-04-16 v1 计算与语言 信息检索

摘要

在多标签文本分类(MLTC)中学习有效表示是自然语言处理领域的一项重大挑战。这一挑战源于任务固有的复杂性,由两个关键因素塑造:标签之间的复杂联系以及数据普遍存在的长尾分布。为解决此问题,一种潜在方法是将监督对比学习与经典监督损失函数相结合。尽管对比学习在多类分类中表现出色,但其在多标签框架中的影响尚未得到深入研究。本文深入研究了监督对比学习及其在MLTC背景下对表示的影响。我们强调了考虑长尾数据分布以构建鲁棒表示空间的重要性,这有效解决了我们识别出的对比学习相关的两个关键挑战:“正样本缺失”和“吸引-排斥不平衡”。基于这一见解,我们为MLTC引入了一种新颖的对比损失函数。该函数在三个多标签数据集上获得的Micro-F1分数与其它常用损失函数相当或更优,并在Macro-F1分数上表现出显著提升。

关键词

引用

@article{arxiv.2404.08720,
  title  = {Exploring Contrastive Learning for Long-Tailed Multi-Label Text Classification},
  author = {Alexandre Audibert and Aurélien Gauffre and Massih-Reza Amini},
  journal= {arXiv preprint arXiv:2404.08720},
  year   = {2024}
}

备注

14 pages, 2 figures