面向极端文本分类的极端零样本学习
机器学习
2021-12-17 v1 计算与语言
摘要
极端多标签文本分类(XMC)问题关注从大规模标签集中为输入文本实例找到最相关的标签。然而,XMC 设定面临两个挑战:(1) 它无法泛化到动态环境中预测未见标签,以及 (2) 它需要大量监督(实例,标签)对,而对于新兴领域这可能难以获取。近来,广义零样本 XMC(GZ-XMC)设定已被研究,并相应提出了 ZestXML 以处理未见标签,但其仍需要大量标注(实例,标签)对。在本文中,我们考虑一个更实际的场景称为极端零样本 XMC(EZ-XMC),其中无需监督,仅可访问实例和标签的原始文本。作为 EZ-XMC 扩展且带有限监督的少样本 XMC(FS-XMC)也被研究。为了用原始文本学习实例和标签的语义嵌入,我们提出以自监督对比损失预训练基于 Transformer 的编码器。具体而言,我们开发了预训练方法 MACLR,其充分利用原始文本,采用多尺度自适应聚类、标签正则化以及利用伪正对的自我训练等技术。在四个公开 EZ-XMC 数据集上的实验结果表明,MACLR 相较于所有其他领先基线方法取得了更优性能,尤其平均精确率和召回率提升约 5-10%。此外,我们还表明当训练中存在有限数量的真值正对时,我们的预训练编码器可在 FS-XMC 上进一步提升。通过在如此少样本子集上微调编码器,MACLR 仍显著优于其他极端分类器。
引用
@article{arxiv.2112.08652,
title = {Extreme Zero-Shot Learning for Extreme Text Classification},
author = {Yuanhao Xiong and Wei-Cheng Chang and Cho-Jui Hsieh and Hsiang-Fu Yu and Inderjit Dhillon},
journal= {arXiv preprint arXiv:2112.08652},
year = {2021}
}
备注
Our code is available at https://github.com/amzn/pecos/tree/mainline/examples/MACLR