WC-SBERT:基于 SBERT 与自训练实现维基百科分类的零样本文本分类
计算与语言
2023-07-31 v1 人工智能
摘要
我们的研究专注于解决自然语言处理(NLP)中的零样本文本分类问题,尤其侧重于创新的自我训练策略。为实现这一目标,我们提出了一种新颖的自训练策略,该策略使用标签而非文本进行训练,显著减少了模型的训练时间。具体而言,我们使用维基百科的分类作为训练集,并利用 SBERT 预训练模型在同一文本内的分类对之间建立正相关,以促进关联训练。对于新的测试数据集,我们改进了原有的自训练方法,消除对每个目标数据集的先验训练与测试数据的需求。相反,我们采用维基百科作为统一训练数据集,以更好地逼近零样本场景。这一修改使得在不同数据集上能够快速微调与推理,极大减少了自训练所需时间。我们的实验结果表明,该方法能够在数分钟内使模型适配目标数据集。与其他基于 BERT 的 transformer 模型相比,我们的方法仅通过标签而非实际文本进行训练,显著减少了训练数据量,并通过使用统一训练集大幅提升了训练效率。此外,我们的方法在 Yahoo Topic 和 AG News 数据集上均取得了最先进(SOTA)的结果。
引用
@article{arxiv.2307.15293,
title = {WC-SBERT: Zero-Shot Text Classification via SBERT with Self-Training for Wikipedia Categories},
author = {Te-Yu Chi and Yu-Meng Tang and Chia-Wen Lu and Qiu-Xia Zhang and Jyh-Shing Roger Jang},
journal= {arXiv preprint arXiv:2307.15293},
year = {2023}
}