面向多标签文本分类的标签级文档预训练
计算与语言
2020-08-18 v1
摘要
多标签文本分类(MLTC)的一大挑战在于如何有效利用可能的标签差异与标签关联。本文通过提出标签级预训练(LW-PT)方法来应对该挑战,以获取蕴含标签感知信息的文档表示。其基本思想是:多标签文档可表示为多个标签级表示的组合,且相关标签总在同一或相似文档中共现。LW-PT通过构建标签级文档分类任务并训练标签级文档编码器来实现该思想。最终,预训练的标签级编码器与下游MLTC任务进行微调。充分的实验结果证实,所提方法相较先前SOTA模型具有显著优势,且能够发现合理的标签关系。代码已公开以方便其他研究者。
引用
@article{arxiv.2008.06695,
title = {Label-Wise Document Pre-Training for Multi-Label Text Classification},
author = {Han Liu and Caixia Yuan and Xiaojie Wang},
journal= {arXiv preprint arXiv:2008.06695},
year = {2020}
}
备注
Accepted to NLPCC 2020