ZeroBERTo:利用主题建模增强零样本文本分类
计算与语言
2022-06-07 v3 人工智能
机器学习
摘要
传统文本分类方法通常需要大量标注数据,这类数据难以获取,尤其在受限领域或较不普及的语言中。标注数据的缺乏催生了低资源方法,其假设自然语言处理中数据可用性低。其中,零样本学习尤为突出,即在不使用任何先前标注数据的情况下学习分类器。该方法报道的最佳结果使用了 Transformer 等语言模型,但存在两个问题:执行时间长,且无法处理长文本输入。本文提出新模型 ZeroBERTo,在分类任务前利用无监督聚类步骤获得压缩的数据表示。我们表明 ZeroBERTo 对长输入具有更好性能且执行时间更短,在 FolhaUOL 数据集上以约 12% 的 F1 分数优于 XLM-R。关键词:低资源 NLP、无标注数据、零样本学习、主题建模、Transformer。
引用
@article{arxiv.2201.01337,
title = {ZeroBERTo: Leveraging Zero-Shot Text Classification by Topic Modeling},
author = {Alexandre Alcoforado and Thomas Palmeira Ferraz and Rodrigo Gerber and Enzo Bustos and André Seidel Oliveira and Bruno Miguel Veloso and Fabio Levy Siqueira and Anna Helena Reali Costa},
journal= {arXiv preprint arXiv:2201.01337},
year = {2022}
}
备注
Accepted at PROPOR 2022: 15th International Conference on Computational Processing of Portuguese