中文

基于自适应概率标签簇的预训练广义自回归模型用于极端多标签文本分类

机器学习 2020-08-18 v2 机器学习

摘要

极端多标签文本分类(XMTC)是从极大规模标签集中为给定文本标注最相关标签的任务。我们提出一种称为 APLC-XLNet 的新型深度学习方法。我们的方法对近期发布的广义自回归预训练模型(XLNet)进行微调,以学习输入文本的稠密表示。我们提出自适应概率标签簇(APLC),利用不平衡的标签分布形成显式降低计算时间的簇,从而近似交叉熵损失。我们在五个基准数据集上进行的实验表明,我们的方法在四个基准数据集上取得了新的最先进结果。我们的源代码公开于 https://github.com/huiyegit/APLC_XLNet。

关键词

引用

@article{arxiv.2007.02439,
  title  = {Pretrained Generalized Autoregressive Model with Adaptive Probabilistic Label Clusters for Extreme Multi-label Text Classification},
  author = {Hui Ye and Zhiyu Chen and Da-Han Wang and Brian D. Davison},
  journal= {arXiv preprint arXiv:2007.02439},
  year   = {2020}
}

备注

Accepted by ICML 2020