中文

Fix-A-Step:基于未筛选无标签数据的半监督学习

机器学习 2023-05-29 v3 人工智能 计算机视觉与模式识别

摘要

半监督学习(SSL)有望通过同时在大量无标签图像上训练,相比在小规模有标签数据集上训练分类器获得更高精度。在医学影像等真实应用中,无标签数据是为求便捷而收集的,因此未经筛选:其在类别或特征上可能与有标签集不同。遗憾的是,现代深度 SSL 在给定未筛选无标签数据时往往使精度更差。近期复杂的补救方法试图检测分布外无标签图像,随后将其丢弃或降权。相反,我们引入 Fix-A-Step,一种更简单的流程,将所有未筛选无标签图像视为潜在有用。我们的第一个洞见是,即便未筛选图像也能产生有标签数据的有用增广。其次,我们修改梯度下降更新,以防止优化多任务 SSL 损失损害有标签集精度。Fix-A-Step 可修复许多常见深度 SSL 方法,在 CIFAR 基准上跨所有被测方法与人工类别不匹配程度提升精度。在一个称为 Heart2Heart 的新医学 SSL 基准上,Fix-A-Step 能从 353,500 张真实未筛选超声图像中学习,带来可跨医院泛化的提升。

关键词

引用

@article{arxiv.2208.11870,
  title  = {Fix-A-Step: Semi-supervised Learning from Uncurated Unlabeled Data},
  author = {Zhe Huang and Mary-Joy Sidhom and Benjamin S. Wessler and Michael C. Hughes},
  journal= {arXiv preprint arXiv:2208.11870},
  year   = {2023}
}

备注

AISTATS 2023 (Oral)