基于强化学习的半监督学习
机器学习
2024-05-06 v1 人工智能
摘要
近年来,由于能够利用标记数据和未标记数据来提高模型性能(尤其是在标记数据稀缺时),半监督学习(SSL)受到了广泛关注。然而,大多数当前的SSL方法依赖于启发式方法或预定义规则来生成伪标签和利用未标记数据。它们受限于在标准范数内使用损失函数和正则化方法。在本文中,我们提出了一种新颖的强化学习(RL)指导的SSL方法,RLGSSL,将SSL表述为一个单臂赌博机问题,并部署一种创新的基于加权奖励的RL损失,以适应性地引导预测模型的学习过程。RLGSSL包含一个仔细设计的奖励函数,在标记数据和未标记数据的使用之间进行平衡,以增强泛化性能。进一步部署了半监督教师-学生框架以提高学习稳定性。我们通过在几个基准数据集上的广泛实验表明,RLGSSL的有效性,并显示我们的做法实现了对比最先进SSL方法的持久优势。
引用
@article{arxiv.2405.01760,
title = {Reinforcement Learning-Guided Semi-Supervised Learning},
author = {Marzi Heidari and Hanping Zhang and Yuhong Guo},
journal= {arXiv preprint arXiv:2405.01760},
year = {2024}
}