利用自动阈值处理分布外数据以改进半监督深度学习用于胸片COVID-19检测
图像与视频处理
2022-11-07 v1 计算机视觉与模式识别
摘要
半监督学习(SSL)在标注数据有限且未标注数据庞大时,利用标注与未标注数据训练模型。未标注数据常比标注数据更易获取,因此在标注数据稀缺时,该数据被用于提升模型的泛化水平。然而,在真实场景中,未标注数据可能呈现与标注数据集分布不同的分布。这被称为分布失配。当未标注数据来源不同于标注数据时,该问题通常出现。例如,在医学影像领域,当使用胸部 X 光图像训练 COVID-19 检测器时,可能用到采自不同医院的不同未标注数据集。本工作中,我们提出一种自动阈值方法来过滤未标注数据集中的分布外数据。我们利用预训练 ImageNet 特征提取器(FE)构建的特征空间,计算标注与未标注数据集间的马氏距离,为每个未标注观测打分。我们在使用胸部 X 光图像训练 COVID-19 检测器的背景下测试了两种简单的自动阈值方法。所测方法为训练半监督深度学习架构时界定保留哪些未标注数据提供了自动方式。
引用
@article{arxiv.2211.02142,
title = {Improving Semi-supervised Deep Learning by using Automatic Thresholding to Deal with Out of Distribution Data for COVID-19 Detection using Chest X-ray Images},
author = {Isaac Benavides-Mata and Saul Calderon-Ramirez},
journal= {arXiv preprint arXiv:2211.02142},
year = {2022}
}