中文

分布外数据如何损害半监督学习

机器学习 2023-02-02 v3

摘要

近期的半监督学习算法由于更好的未标注数据表示而取得了更高整体性能的更大成功。然而,近期研究表明,当未标注集包含分布外样本(OODs)时,SSL 算法的性能会下降。本工作解决以下问题:分布外(OOD)数据如何对半监督学习算法产生不利影响?为回答该问题,我们研究了 OOD 对 SSL 算法负面作用的关键原因。具体而言,我们发现 1)某些靠近决策边界的 OOD 数据实例比远离边界的实例对性能有更显著的影响,且 2)批归一化(BN)——一种流行模块——当未标注集包含 OOD 时可能降低而非提升性能。在此背景下,我们开发了统一的加权鲁棒 SSL 框架,可轻松扩展至许多现有 SSL 算法并提升其对 OOD 的鲁棒性。更具体地,我们开发了高效的双层优化算法,能容纳目标的高阶近似并扩展至多个内层优化步骤,以学习大量权重参数,同时优于现有的双层优化低阶近似。此外,我们对 BN 步骤中远距离 OOD 的影响进行理论研究,并提出加权批归一化(WBN)程序以改善性能。最后,我们讨论本方法与低阶近似技术间的联系。我们在合成与真实世界数据集上的实验表明,相较于四种最先进的鲁棒 SSL 策略,所提方法显著增强了四种代表性 SSL 算法对 OOD 的鲁棒性。

关键词

引用

@article{arxiv.2010.03658,
  title  = {How Out-of-Distribution Data Hurts Semi-Supervised Learning},
  author = {Xujiang Zhao and Killamsetty Krishnateja and Rishabh Iyer and Feng Chen},
  journal= {arXiv preprint arXiv:2010.03658},
  year   = {2023}
}

备注

Accepted to ICDM'22