极弱监督文本分类基准:协调种子词匹配与提示方法
计算与语言
2023-05-23 v1
摘要
极弱监督文本分类(XWS-TC)指基于最少高层人类指导(如若干指示标签的种子词或分类指令)的文本分类。XWS-TC 有两类主流方法,但从未被严格比较过:(1) 基于(软)匹配种子词生成的伪标签训练分类器(SEED);(2) 使用分类指令(及原始文本)提示(并校准)语言模型以解码标签词(PROMPT)。本文提出首个 XWS-TC 基准,在公平条件下比较两种方法,其中数据集、监督信号与超参数选择在各方法间标准化。我们的基准结果表明:(1) SEED 与 PROMPT 均具竞争力,无明显胜者;(2) SEED 在经验上比 PROMPT 对人类指导(如种子词、分类指令与标签词)变动更具容忍度;(3) SEED 在经验上比 PROMPT 对预训练语言模型更具选择性;(4) 近期 SEED 与 PROMPT 方法联系紧密,且基于原始领域内文本的聚类后处理步骤对两者均为强劲的性能提升器。我们希望该基准可作为不同场景下选择 XWS-TC 方法的指南,并激发开发对指导与模型鲁棒的 XWS-TC 方法的兴趣。代码发布于 https://github.com/ZihanWangKi/x-TC。
引用
@article{arxiv.2305.12749,
title = {A Benchmark on Extremely Weakly Supervised Text Classification: Reconcile Seed Matching and Prompting Approaches},
author = {Zihan Wang and Tianle Wang and Dheeraj Mekala and Jingbo Shang},
journal= {arXiv preprint arXiv:2305.12749},
year = {2023}
}
备注
ACL 2023 Findings