中文

MedShift:面向医学数据集构建的偏移数据识别方法

图像与视频处理 2021-12-30 v1 计算机视觉与模式识别

摘要

为构建高质量数据集,识别内部与外部数据源之间的数据差异是一项基础且关键的步骤。然而,用于检测数据偏移或差异的方法尚未得到充分研究。其挑战在于缺乏学习数据集稠密表示的有效方法,以及医疗机枃间难以共享隐私数据。为克服这些问题,我们提出一种称为 MedShift 的统一流程,用于检测顶层偏移样本,从而辅助医学数据构建。以内部数据集 A 作为基础源,我们首先以无监督方式对数据集 A 的每个类别训练异常检测器,以学习内部分布。其次,在不跨源交换数据的情况下,我们将训练好的异常检测器逐类应用于外部数据集 B。异常分数高的样本被识别为偏移数据。为量化外部数据集的偏移程度,我们基于所得分数将 B 的数据按类聚类为若干组。随后我们在 A 上训练一个多类分类器,并通过逐类逐步丢弃异常分数最大的组、观测该分类器在 B 上性能的方差来衡量偏移程度。此外,我们采用一种数据集质量度量来帮助检视多个医学源之间的分布差异。我们利用来自多个外部源的肌肉骨骼 X 射线(MURA)与胸部 X 射线数据集验证了 MedShift 的有效性。实验表明,我们提出的偏移数据检测流程有助于医疗中心更高效地构建高质量数据集。用于可视化结果的界面介绍视频见 https://youtu.be/V3BF0P1sxQE。

关键词

引用

@article{arxiv.2112.13885,
  title  = {MedShift: identifying shift data for medical dataset curation},
  author = {Xiaoyuan Guo and Judy Wawira Gichoya and Hari Trivedi and Saptarshi Purkayastha and Imon Banerjee},
  journal= {arXiv preprint arXiv:2112.13885},
  year   = {2021}
}

备注

35 pages, 28 figures, 2 tables