用于少样本文本分类的标签语义感知预训练
计算与语言
2022-05-31 v2
摘要
在文本分类任务中,有用信息编码于标签名称中。标签语义感知系统已在微调和预测期间利用该信息来提升文本分类性能。然而,预训练期间标签语义的使用尚未被广泛探索。因此我们提出标签语义感知预训练(LSAP)以提升文本分类系统的泛化能力和数据效率。LSAP通过对来自多个领域的带标签句子进行二次预训练,将标签语义整合进预训练生成模型(在我们的工作中为T5)。由于领域通用预训练需要大量数据,我们开发了一个过滤与标注流水线,从未标注文本中自动创建句子-标签对。我们在意图(ATIS、Snips、TOPv2)和主题分类(AG News、Yahoo! Answers)上进行了实验。LSAP在少样本文本分类上相比最先进模型取得了显著的准确率提升,同时在资源充足场景下保持了与最先进模型相当的性能。
引用
@article{arxiv.2204.07128,
title = {Label Semantic Aware Pre-training for Few-shot Text Classification},
author = {Aaron Mueller and Jason Krone and Salvatore Romeo and Saab Mansour and Elman Mansimov and Yi Zhang and Dan Roth},
journal= {arXiv preprint arXiv:2204.07128},
year = {2022}
}
备注
Accepted at ACL 2022