文本拼接:文本分类中少数类别的近分布弱监督方法
计算与语言
2024-06-18 v1
摘要
对于极端弱监督的文本分类,初始研究通过从原始语料中挖掘与类别名称相似的文本来生成伪标签,这可能导致少数类别拥有极少甚至没有样本。近期研究尝试通过使用类别名称或定义来对话式大语言模型进行提示生成相关文本,但存在生成数据未能分布于实际语料中(即文本分类器将要应用的语料)的高风险,从而导致模型难以泛化。本文提出一种新框架——文本拼接(text grafting),以融合这两种方法的优势,通过一种新颖的方法来弥合差距,从而为少数类别获取干净且近分布的弱监督。具体而言,我们首先利用基于大语言模型的 logits 从原始语料中挖掘出具有高潜力用于合成目标少数类别数据的掩码模板。随后,利用最先进的大语言模型填充这些模板,以合成落入少数类别的近分布文本。文本拼接在少数类别上显著优于直接挖掘或合成方法。我们还通过分析和案例研究来理解文本拼接的特性。
引用
@article{arxiv.2406.11115,
title = {Text Grafting: Near-Distribution Weak Supervision for Minority Classes in Text Classification},
author = {Letian Peng and Yi Gu and Chengyu Dong and Zihan Wang and Jingbo Shang},
journal= {arXiv preprint arXiv:2406.11115},
year = {2024}
}