中文

面向少样本层次文本分类的层次化 verbalizer

计算与语言 2023-05-29 v1

摘要

由于实践中复杂的标签层次结构和密集的标注成本,层次文本分类(HTC)性能较差,尤其是在考虑低资源或少样本设置时。近来,在预训练语言模型(PLMs)上应用提示(prompt)的趋势日益增长,这已在少样本扁平文本分类任务中展现出有效性。然而,在训练数据极度稀缺时,研究基于提示学习范式解决 HTC 问题的工作十分有限。在本工作中,我们定义了基于路径的少样本设置,并建立严格的基于路径的评估指标,以进一步探索少样本 HTC 任务。为解决该问题,我们提出了层次化 verbalizer("HierVerb"),这是一个多 verbalizer 框架,将 HTC 视为多层上的单标签或多标签分类问题,并学习受层次结构和层次对比学习约束的向量作为 verbalizer。通过这种方式,HierVerb 将标签层次知识融合进 verbalizer 中,并显著优于那些通过图编码器注入层次结构的方法,最大化了 PLMs 的收益。在三个流行 HTC 数据集上的少样本设置下的广泛实验表明,带有 HierVerb 的提示显著提升了 HTC 性能,同时也指出了一种优雅的方式来弥合大型预训练模型与下游层次分类任务之间的差距。我们的代码和少样本数据集公开于 https://github.com/1KE-JI/HierVerb。

关键词

引用

@article{arxiv.2305.16885,
  title  = {Hierarchical Verbalizer for Few-Shot Hierarchical Text Classification},
  author = {Ke Ji and Yixin Lian and Jingsheng Gao and Baoyuan Wang},
  journal= {arXiv preprint arXiv:2305.16885},
  year   = {2023}
}

备注

14 pages, 8 figures, Accepted by ACL 2023