基于平衡深层表示分布的半监督学习
机器学习
2026-03-24 v1
摘要
半监督文本分类(SSTC)主要遵循自训练思想. 它们通过在标记文本上训练来初始化深度分类器;然后交替预测标记为伪标签的未标记文本,并在标记和伪标签文本的混合集上训练深度分类器. 自然地,其性能很大程度上取决于对未标记文本伪标签的准确性. 不幸的是,这些方法常常因标记文本表示分布差异大导致的边际偏差问题而表现不佳. 为缓解此问题,我们应用角度边际损失,并进行若干高斯线性变换,以实现标签角方差的平衡,即同一标签下文本角度的方差. 通过约束所有标签角方差平衡,可以获得更准确的伪标签预测,其中这些方差是在自训练循环中同时在标记和伪标签文本上估计的. 基于此洞见,我们提出一种新型 SSTC 方法,即基于平衡深层表示分布的半监督文本分类(S2TC-BDD). 我们通过引入一些伪标签技巧和正则化项,实现了 S2TC-BDD 的多类分类和多标签分类版本. 为评估 S2TC-BDD,我们将其与最新的 SSTC 方法进行比较. 实证结果表明,S2TC-BDD 的有效性尤其在标记文本稀缺时表现突出.
引用
@article{arxiv.2603.21056,
title = {Semi-Supervised Learning with Balanced Deep Representation Distributions},
author = {Changchun Li and Ximing Li and Bingjie Zhang and Wenting Wang and Jihong Ouyang},
journal= {arXiv preprint arXiv:2603.21056},
year = {2026}
}