BERT-Flow-VAE:一种用于多标签文本分类的弱监督模型
计算与语言
2022-10-28 v1
摘要
多标签文本分类(MLTC)是将文档归类到一个或多个主题的任务。考虑到此类任务的大量数据和不同领域,全监督学习需要人工完全标注的数据集,成本高且耗时。本文提出BERT-Flow-VAE(BFV),一种弱监督多标签文本分类(WSMLTC)模型,减少了对全监督的需求。该新模型(1)生成BERT句嵌入并使用流模型对其进行校准,(2)通过平均种子稀疏主题模型和文本蕴含模型的结果生成初始主题-文档矩阵,这两个模型仅需主题的表面名称和每个主题4-6个种子词,(3)采用VAE框架在主题-文档矩阵的引导下重构嵌入。最后,(4)使用VAE架构中编码器模型产生的均值作为MLTC的预测。在6个多标签数据集上的实验结果表明,BFV在关键指标上显著优于其他基线WSMLTC模型,并达到全监督模型约84%的性能。
引用
@article{arxiv.2210.15225,
title = {BERT-Flow-VAE: A Weakly-supervised Model for Multi-Label Text Classification},
author = {Ziwen Liu and Josep Grau-Bove and Scott Allan Orr},
journal= {arXiv preprint arXiv:2210.15225},
year = {2022}
}
备注
8 pages, 4 figures