利用蕴含式建模解决文本分类中的概念漂移
计算与语言
2023-11-07 v1
摘要
预训练语言模型 (PLMs) 在自然语言处理 (NLP) 的文本分类 (TC) 问题中取得了巨大成功。在许多真实世界文本分类任务中,所学类别的定义并非恒定不变,而是随时间变化——这被称为概念漂移 (Concept Shift)。大多数处理概念漂移的技术依赖于用新标注数据重新训练旧分类器。然而,鉴于微调大型深度学习模型以适应新概念所需的训练数据量,相关的标注成本可能高得令人望而却步且耗时。在这项工作中,我们提出一种重构方法,将普通分类转换为蕴含式问题,仅需显著更少的数据即可重新训练文本分类器以适应新概念。我们在真实世界和合成数据集上证明了所提方法的有效性,在少样本设置下分别实现了高达 7% 和 40% 的绝对 F1 提升。此外,部署后,我们的方案还帮助整体节省了 75% 的标注成本。
引用
@article{arxiv.2311.03320,
title = {Tackling Concept Shift in Text Classification using Entailment-style Modeling},
author = {Sumegh Roychowdhury and Karan Gupta and Siva Rajesh Kasa and Prasanna Srinivasa Murthy and Alok Chandra},
journal= {arXiv preprint arXiv:2311.03320},
year = {2023}
}