LIME:无需种子词的弱监督文本分类
计算与语言
2022-10-14 v1 人工智能
摘要
在弱监督文本分类中,仅类别名称作为监督来源。主流的弱监督文本分类方法采用两阶段框架:先为测试样本赋予伪标签,再用以训练神经文本分类器。在多数既往工作中,伪标注步骤依赖于获取最能捕捉各类别标签相关性的种子词。我们提出 LIME,一种完全以基于蕴含的伪分类替代脆弱的种子词生成过程的弱监督文本分类框架。我们发现将弱监督分类与文本蕴含相结合可缓解两者的不足,从而形成更流畅且有效的分类流程。仅借助现成的文本蕴含模型,LIME 在弱监督文本分类上优于近期基线,并在 4 个基准上达到最先进水平。我们在 https://github.com/seongminp/LIME 开源代码。
引用
@article{arxiv.2210.06720,
title = {LIME: Weakly-Supervised Text Classification Without Seeds},
author = {Seongmin Park and Jihwa Lee},
journal= {arXiv preprint arXiv:2210.06720},
year = {2022}
}
备注
COLING 2022. Code at https://github.com/seongminp/LIME