中文

面向零样本多标签文本分类的元数据诱导对比学习

计算与语言 2023-10-24 v2 机器学习

摘要

大规模多标签文本分类(large-scale multi-label text classification, LMTC)旨在将文档与其来自大型候选集的相关标签相关联。大多数现有 LMTC 方法依赖大量人工标注的训练数据,这些数据往往获取成本高昂,且受长尾标签分布困扰(即许多标签在训练集中仅出现数次)。本文研究零样本设定下的 LMTC,其不需要任何带标签的标注文档,仅依赖标签表面名称与描述。为训练一个计算文档与标签间相似度分数的分类器,我们提出一种新颖的元数据诱导对比学习(metadata-induced contrastive learning, MICoL)方法。与先前基于文本的对比学习技术不同,MICoL 利用文档元数据(如研究论文的作者、发表场所和参考文献),这些元数据在 Web 上广泛可用,以推导相似的文档-文档对。在两个大规模数据集上的实验结果表明:(1) MICoL 显著优于强零样本文本分类与对比学习基线;(2) MICoL 与在最先进的有监督元数据感知 LMTC 方法(训练于 10K–200K 标注文档)表现相当;(3) MICoL 比有监督方法倾向于预测更多低频标签,从而缓解了长尾标签上退化的性能。

关键词

引用

@article{arxiv.2202.05932,
  title  = {Metadata-Induced Contrastive Learning for Zero-Shot Multi-Label Text Classification},
  author = {Yu Zhang and Zhihong Shen and Chieh-Han Wu and Boya Xie and Junheng Hao and Ye-Yi Wang and Kuansan Wang and Jiawei Han},
  journal= {arXiv preprint arXiv:2202.05932},
  year   = {2023}
}

备注

12 pages; Accepted to WWW 2022