中文

基于图接地预训练与提示的低资源文本分类增强

信息检索 2023-05-08 v1

摘要

文本分类是信息检索中的基础问题,具有许多现实应用,例如预测在线文章主题与电商产品描述类别。然而,少标注或无标注样本的低资源文本分类,对监督学习构成严重挑战。同时,许多文本数据天然接地于网络结构,如在线文章的超链接/引文网络、电商产品的用户-物品购买网络。这些图结构捕获了丰富的语义关系,有望增强低资源文本分类。在本文中,我们提出一种称为图接地预训练与提示(G2P2)的新模型,以双管齐下的方式解决低资源文本分类。在预训练阶段,我们提出三种基于图交互的对比策略联合预训练图-文本模型;在下游分类阶段,我们探索对该联合预训练模型使用提示以实现低资源分类。在四个真实数据集上的大量实验证明了 G2P2 在零样本与少样本低资源文本分类任务中的优势。

关键词

引用

@article{arxiv.2305.03324,
  title  = {Augmenting Low-Resource Text Classification with Graph-Grounded Pre-training and Prompting},
  author = {Zhihao Wen and Yuan Fang},
  journal= {arXiv preprint arXiv:2305.03324},
  year   = {2023}
}

备注

11 pages, accepted by SIGIR'23