AttentionXML:基于标签树的注意力感知深度模型用于高性能极端多标签文本分类
计算与语言
2019-11-05 v3 机器学习
摘要
极端多标签文本分类(XMTC)在大数据时代是一个重要问题,旨在从极大规模的标签集中为给定文本标注最相关的多个标签。XMTC 可见于许多应用中,如商品分类、网页标注和新闻注释。传统上多数方法使用词袋(BOW)作为输入,忽略了词上下文及深层语义信息。近期利用深度学习克服 BOW 问题的尝试仍受限于:1)未能捕捉每个标签的重要子文本;2)面对海量标签缺乏可扩展性。我们提出了一种用于 XMTC 的基于标签树的深度学习新模型,称为 AttentionXML,具有两个独特特征:1)以原始文本作为输入的多标签注意力机制,可捕捉与每个标签最相关的文本部分;2)浅而宽的概率标签树(PLT),可处理数百万标签,尤其是“长尾标签”。我们在六个基准数据集(包括含约 300 万标签的 Amazon-3M)上将 AttentionXML 与八种最先进方法的性能进行了实证比较。在所有实验设定下 AttentionXML 均优于所有竞争方法。实验结果还表明,在基于标签树的方法中 AttentionXML 对长尾标签取得了最佳性能。代码与数据集可在 http://github.com/yourh/AttentionXML 获取。
引用
@article{arxiv.1811.01727,
title = {AttentionXML: Label Tree-based Attention-Aware Deep Model for High-Performance Extreme Multi-Label Text Classification},
author = {Ronghui You and Zihan Zhang and Ziye Wang and Suyang Dai and Hiroshi Mamitsuka and Shanfeng Zhu},
journal= {arXiv preprint arXiv:1811.01727},
year = {2019}
}
备注
Accepted by NeurIPS 2019