双重稳健自训练
机器学习
2023-11-06 v3 人工智能
计算机视觉与模式识别
图像与视频处理
机器学习
摘要
自训练是解决半监督学习问题的一项重要技术。它通过生成伪标签并将其与有限的标记数据集结合来进行训练,从而利用未标记数据。自训练的有效性在很大程度上依赖于这些伪标签的准确性。在本文中,我们提出了双重稳健自训练,一种可证明地在两个极端之间取得平衡的新颖半监督算法。当伪标签完全错误时,我们的方法退化为仅使用标记数据的训练过程。相反,当伪标签完全准确时,我们的方法转变为利用所有伪标签数据和标记数据进行训练的过程,从而增大有效样本量。通过在 ImageNet 图像分类数据集和 nuScenes 自动驾驶数据集上的 3D 目标检测进行实证评估,我们证明了双重稳健损失相对于标准自训练基线的优越性。
引用
@article{arxiv.2306.00265,
title = {Doubly Robust Self-Training},
author = {Banghua Zhu and Mingyu Ding and Philip Jacobson and Ming Wu and Wei Zhan and Michael Jordan and Jiantao Jiao},
journal= {arXiv preprint arXiv:2306.00265},
year = {2023}
}