中文

OTSeq2Set:一种用于极端多标签文本分类的最优传输增强序列到集合模型

计算与语言 2022-11-29 v2 人工智能 机器学习

摘要

极端多标签文本分类(XMTC)是从极大规模标签集合中寻找最相关子集标签的任务。最近,一些深度学习模型在 XMTC 任务中取得了 state-of-the-art 的结果。这些模型通常通过一个作为模型最后一层的全连接层来预测所有标签的分数。然而,此类模型无法为每个文档预测一个相对完整且长度可变的标签子集,因为它们通过固定阈值选择与文档相关的正标签,或者按分数降序取前 k 个标签。一种不太主流的深度学习模型称为序列到序列(Seq2Seq),侧重于以序列方式预测长度可变的正标签。然而,XMTC 任务中的标签本质上是一个无序集合而不是有序序列,标签的默认顺序在训练中限制了 Seq2Seq 模型。为了解决 Seq2Seq 中的这一局限性,我们提出了一种用于 XMTC 任务的自回归序列到集合模型,命名为 OTSeq2Set。我们的模型在 student-forcing 方案中生成预测,并通过基于二部匹配的损失函数进行训练,从而实现排列不变性。同时,我们使用最优传输距离作为度量,迫使模型关注语义标签空间中最接近的标签。实验表明,OTSeq2Set 在 4 个基准数据集上优于其他有竞争力的基线。特别是在具有 31k 个标签的 Wikipedia 数据集上,它在 micro-F1 分数上比 state-of-the-art 的 Seq2Seq 方法高出 16.34%。代码可在 https://github.com/caojie54/OTSeq2Set 获取。

关键词

引用

@article{arxiv.2210.14523,
  title  = {OTSeq2Set: An Optimal Transport Enhanced Sequence-to-Set Model for Extreme Multi-label Text Classification},
  author = {Jie Cao and Yin Zhang},
  journal= {arXiv preprint arXiv:2210.14523},
  year   = {2022}
}

备注

EMNLP 2022