MEGClass:基于互增强文本粒度的极弱监督文本分类方法
计算与语言
2023-10-31 v2 人工智能
摘要
文本分类对于组织非结构化文本至关重要。传统方法依赖人工标注,或近来依赖一组类别种子词作为监督,这可能代价高昂,尤其对专门或新兴领域。为此,已有研究提出仅使用类别表面名称作为极弱监督。然而,现有方法独立处理不同层次的文本粒度(文档、句子或词),忽视了粒度间类别不一致性以及仅能通过联合抽取识别的上下文。为解决这些问题,我们引入 MEGClass,一种利用互增强文本粒度的极弱监督文本分类方法。MEGClass 通过联合考虑文档中最具类别指示性的词与句子,利用由此获得的粗粒度与细粒度上下文信号。该方法能够学习捕捉最具判别性类别指示符的上下文化文档表示。通过保持潜在类别的异质性,MEGClass 可选取最具信息量的类别指示文档作为迭代反馈,以增强基于初始词的类别表示,并最终微调预训练文本分类器。在七个基准数据集上的大量实验表明,MEGClass 优于其他弱监督与极弱监督方法。
引用
@article{arxiv.2304.01969,
title = {MEGClass: Extremely Weakly Supervised Text Classification via Mutually-Enhancing Text Granularities},
author = {Priyanka Kargupta and Tanay Komarlu and Susik Yoon and Xuan Wang and Jiawei Han},
journal= {arXiv preprint arXiv:2304.01969},
year = {2023}
}
备注
Code: https://github.com/pkargupta/MEGClass/