中文

基于目标掩码的伪标签半监督文本分类预训练效率研究

计算与语言 2025-05-13 v1

摘要

我们扩展并研究了Hatefi 等人提出的用于文本分类的半监督模型,该模型适用于文档类别由少量标注样本描述、而绝大多数训练样本未标注的分类任务。该模型利用 Meta Pseudo Labels 的教师-学生架构,其中“教师”为未标注的训练数据生成标签以训练“学生”,并根据学生在标注样本上的性能迭代更新其模型。我们通过引入基于目标掩码的无监督预训练阶段扩展了Hatefi 等人的原始模型,并对原始模型、我们的扩展方法以及各种独立基线进行深入的性能评估。实验在两种不同语言(英语和瑞典语)中的三个数据集上进行。

关键词

引用

@article{arxiv.2505.06624,
  title  = {The Efficiency of Pre-training with Objective Masking in Pseudo Labeling for Semi-Supervised Text Classification},
  author = {Arezoo Hatefi and Xuan-Son Vu and Monowar Bhuyan and Frank Drewes},
  journal= {arXiv preprint arXiv:2505.06624},
  year   = {2025}
}