中文

多标签文本分类的组合泛化:一种数据增强方法

计算与语言 2023-12-21 v3

摘要

尽管多标签文本分类取得了显著进展,但现有模型泛化到新颖且罕见的复杂概念(这些概念是基本概念的组合)的能力仍未得到充分探索。本研究填补了这一空白。通过在三个基准测试上创建独特的数据划分,我们评估了现有多标签文本分类模型的组合泛化能力。我们的结果表明,这些模型通常无法泛化到训练期间不常遇到的组合概念,导致在这些新组合的测试中性能较差。为了解决这个问题,我们引入了一种数据增强方法,该方法利用两种创新的文本生成模型来增强分类模型的组合泛化能力。我们的实验表明,这种数据增强方法显著提高了分类模型在我们基准测试上的组合泛化能力,并且两种生成模型都优于其他文本生成基线。

关键词

引用

@article{arxiv.2312.11276,
  title  = {Compositional Generalization for Multi-label Text Classification: A Data-Augmentation Approach},
  author = {Yuyang Chai and Zhuang Li and Jiahui Liu and Lei Chen and Fei Li and Donghong Ji and Chong Teng},
  journal= {arXiv preprint arXiv:2312.11276},
  year   = {2023}
}

备注

Accepted by AAAI'24