中文

基于元优化合成样本的生成式半监督学习

机器学习 2023-09-29 v1 人工智能 计算机视觉与模式识别 机器学习

摘要

半监督学习(SSL)是一种利用有标签与无标签数据集训练深度分类模型的有前景的方法。然而,现有 SSL 方法依赖大规模无标签数据集,由于法律约束(如 GDPR)等诸多现实应用未必总能满足。本文探究如下研究问题:我们能否在无真实无标签数据集的情况下训练 SSL 模型?我们不使用真实无标签数据集,而是提出一种利用生成式基础模型(在涵盖多领域百万级样本的数据集上训练,如 ImageNet)所生成合成数据集的 SSL 方法。我们的核心思路是识别生成式基础模型中模拟无标签样本的合成样本,并利用这些合成样本训练分类器。为此,我们的方法被表述为一个交替优化问题:(i)生成式基础模型的元学习;(ii)利用真实有标签与合成无标签样本的分类器 SSL。针对(i),我们提出一种元学习目标,优化潜变量以生成近似真实有标签样本且最小化验证损失的样本。针对(ii),我们提出一种简单的无监督损失函数,对分类器特征提取器进行正则化,以最大化由合成样本获得的性能提升。我们证实了该方法优于使用生成式基础模型的基线 SSL。我们还展示了在极少有标签数据集场景下,我们的方法优于使用真实无标签数据集的 SSL。这表明合成样本比真实无标签数据更具潜力以更高效的方式提供改进收益。

关键词

引用

@article{arxiv.2309.16143,
  title  = {Generative Semi-supervised Learning with Meta-Optimized Synthetic Samples},
  author = {Shin'ya Yamaguchi},
  journal= {arXiv preprint arXiv:2309.16143},
  year   = {2023}
}

备注

Accepted to the 15th Asian Conference on Machine Learning (ACML2023); a preprint of the camera-ready version