TELEClass:最小监督下的分类体系增强与 LLM 增强型分层文本分类
计算与语言
2025-02-06 v3 机器学习
摘要
分层文本分类旨在将每个文档分类到标签分类体系中的一组类别,这是一项基础的 Web 文本挖掘任务,具有 Web 内容分析和语义索引等广泛应用。大多数早期工作专注于完全或半监督方法,这些方法需要大量人工标注数据,获取成本高且耗时。为了减少人力投入,本文研究仅需最小量监督的分层文本分类:仅使用每个节点的唯一类别名称作为监督。最近,大型语言模型 (LLM) 通过零样本提示在各种任务上表现出竞争性性能,但该方法在分层设置中表现不佳,因为将庞大且结构化的标签空间包含在提示中效果不佳。另一方面,先前的弱监督分层文本分类方法仅利用原始分类体系骨架,忽略了文本语料库中隐藏的丰富信息,这些信息可作为额外的类别指示特征。为应对上述挑战,我们提出了 TELEClass,即分类体系增强与 LLM 增强的弱监督分层文本分类,该方法结合了 LLM 的通用知识与从未标注语料库中挖掘的任务特定特征。TELEClass 自动用类别指示特征丰富原始分类体系以更好地理解标签空间,并利用专为分层设置定制的新型基于 LLM 的数据标注和生成方法。实验表明,TELEClass 显著优于先前的基线方法,同时在推理成本大幅降低的情况下实现了与 LLM 零样本提示相当的性能。
引用
@article{arxiv.2403.00165,
title = {TELEClass: Taxonomy Enrichment and LLM-Enhanced Hierarchical Text Classification with Minimal Supervision},
author = {Yunyi Zhang and Ruozhen Yang and Xueqiang Xu and Rui Li and Jinfeng Xiao and Jiaming Shen and Jiawei Han},
journal= {arXiv preprint arXiv:2403.00165},
year = {2025}
}
备注
Accepted to WWW 2025 Research Track