ESimCSE 无监督对比学习与 UDA 半监督学习联合的大标签系统文本分类模型
机器学习
2023-04-27 v1 计算与语言
摘要
自然语言处理任务中,具有大型标签系统的文本分类面临的挑战包括多标签系统、数据分布不均以及高噪声。为解决这些问题,通过联合训练技术在模型中结合 ESimCSE 无监督对比学习模型与 UDA 半监督对比学习模型。ESimCSE 模型利用无标签数据高效学习文本向量表示以获得更好的分类结果,而 UDA 通过半监督学习方法使用无标签数据进行训练,以提升模型的预测性能与稳定性,并进一步增强模型的泛化能力。此外,模型训练过程中采用对抗训练技术 FGM 和 PGD 以提升模型的鲁棒性与可靠性。实验结果表明,在公共数据集 Ruesters 以及业务数据集上,相对 Baseline 准确率分别提升 8% 和 10%,且在业务数据集上手动验证准确率可提升 15%,表明该方法有效。
引用
@article{arxiv.2304.13140,
title = {ESimCSE Unsupervised Contrastive Learning Jointly with UDA Semi-Supervised Learning for Large Label System Text Classification Mode},
author = {Ruan Lu and Zhou HangCheng and Ran Meng and Zhao Jin and Qin JiaoYu and Wei Feng and Wang ChenZi},
journal= {arXiv preprint arXiv:2304.13140},
year = {2023}
}
备注
This paper contains 14 pages,4 figures,4 tables