中文

基于图增强的低资源文本分类提示微调

信息检索 2024-08-20 v4

摘要

文本分类是信息检索中的基础问题,具有许多现实应用,例如预测在线文章的主题与电商产品描述类别。然而,无或仅有少量标注样本的低资源文本分类,对监督学习构成了严峻挑战。同时,许多文本数据天然基于网络结构,如在线文章的超链接/引文网络、电商产品的用户-物品购买网络。这些图结构捕捉了丰富的语义关系,有望增强低资源文本分类。本文提出一种称为图基础预训练与提示(G2P2)的新模型,以双管齐下的方式解决低资源文本分类问题。在预训练阶段,我们提出三种基于图交互的对比策略来联合预训练图-文本模型;在下游分类阶段,我们为联合预训练模型探索手工离散提示与连续提示微调,分别实现零样本与少样本分类。此外,我们探索了采用连续提示微调进行零样本推断的可能性。具体而言,我们旨在将连续提示泛化至未见类,同时利用一组基类。为此,我们将G2P2扩展为G2P2^*,依赖于一种新的条件提示微调架构。在四个真实数据集上的大量实验证明了G2P2在零样本与少样本低资源文本分类任务中的优势,并展示了G2P2^*$在处理未见类上的优越性。

关键词

引用

@article{arxiv.2307.10230,
  title  = {Prompt Tuning on Graph-augmented Low-resource Text Classification},
  author = {Zhihao Wen and Yuan Fang},
  journal= {arXiv preprint arXiv:2307.10230},
  year   = {2024}
}

备注

15 pages, accepted by TKDE (IEEE Transactions on Knowledge and Data Engineering). arXiv admin note: substantial text overlap with arXiv:2305.03324