真实场景下的文本分类:一个大规模长尾机构名称规范化数据集
计算与语言
2023-02-21 v1 人工智能
摘要
真实世界的数据通常呈现长尾分布,包含少数高频标签和大量小样本标签。机构名称规范化的研究是展示这一现象的完美应用案例。全球有众多机构,其在公开文献中的名称存在巨大差异。在这项工作中,我们首先收集了一个大规模机构名称规范化数据集 LoT-insts1,其中包含超过 25,000 个类别,呈现出自然的长尾分布。为了将小样本和零样本学习场景从海量的大样本类别中分离出来,我们从四个不同的子集构建了测试集:大样本集、中样本集、小样本集以及一个零样本开放集。我们还在我们的数据上复现了几种重要的基线方法,涵盖了从基于搜索的方法到使用预训练 BERT 模型的神经网络方法的广泛范围。此外,我们提出了我们特别预训练的、基于 BERT 的模型,该模型在小样本和零样本测试集上表现出更好的分布外泛化能力。与其他关注长尾现象的数据集相比,我们的数据集训练数据量比现有最大的长尾数据集多一个数量级,并且是自然长尾的,而非人工合成的。我们相信它为研究这一问题提供了一个重要且不同的场景。据我们所知,这是第一个专注于长尾和开放集分类问题的自然语言数据集。
引用
@article{arxiv.2302.09509,
title = {Text Classification in the Wild: a Large-scale Long-tailed Name Normalization Dataset},
author = {Jiexing Qi and Shuhao Li and Zhixin Guo and Yusheng Huang and Chenghu Zhou and Weinan Zhang and Xinbing Wang and Zhouhan Lin},
journal= {arXiv preprint arXiv:2302.09509},
year = {2023}
}
备注
A shorter version is accepted in ICASSP 2023