中文

利用蕴含式建模解决文本分类中的概念漂移

计算与语言 2023-11-07 v1

摘要

预训练语言模型 (PLMs) 在自然语言处理 (NLP) 的文本分类 (TC) 问题中取得了巨大成功。在许多真实世界文本分类任务中,所学类别的定义并非恒定不变,而是随时间变化——这被称为概念漂移 (Concept Shift)。大多数处理概念漂移的技术依赖于用新标注数据重新训练旧分类器。然而,鉴于微调大型深度学习模型以适应新概念所需的训练数据量,相关的标注成本可能高得令人望而却步且耗时。在这项工作中,我们提出一种重构方法,将普通分类转换为蕴含式问题,仅需显著更少的数据即可重新训练文本分类器以适应新概念。我们在真实世界和合成数据集上证明了所提方法的有效性,在少样本设置下分别实现了高达 7% 和 40% 的绝对 F1 提升。此外,部署后,我们的方案还帮助整体节省了 75% 的标注成本。

关键词

引用

@article{arxiv.2311.03320,
  title  = {Tackling Concept Shift in Text Classification using Entailment-style Modeling},
  author = {Sumegh Roychowdhury and Karan Gupta and Siva Rajesh Kasa and Prasanna Srinivasa Murthy and Alok Chandra},
  journal= {arXiv preprint arXiv:2311.03320},
  year   = {2023}
}