中文

学会遗忘:在医学影像研究中构建对数据集偏置的免疫

计算机视觉与模式识别 2018-12-06 v1 机器学习 机器学习

摘要

医学影像机器学习算法通常在单一数据集上评估。尽管训练与测试在该数据集的不同子集上进行,但基于一项研究构建的模型泛化到其他研究的能力有限。尽管数据库偏置已被计算机视觉界视为严重问题,其在医学影像研究中在很大程度上仍未被察觉。因此,迁移学习仍局限于特征表示的重用,需要在新数据集上重新训练。结果,即便在针对同一感兴趣变量采集的影像数据集上训练,机器学习模型也无法泛化。若有可能,无需重新训练便将从一个研究汲取的知识迁移到另一研究,将令人确信模型学习的是所研究问题的基础性知识,而非拘泥于数据集的特异性。本文中,我们将数据集偏置问题置于医学影像研究的背景下。我们展示了此类问题存在于医学数据集中的经验证据。随后,我们提出一种遗忘研究归属的框架,作为处理数据库偏置问题的手段。我们的核心思想是,将数据从原始特征空间映射到中间空间,在该空间中数据点就其来源研究而言不可区分,同时保持对感兴趣变量的识别能力。这将促进模型学习所研究病因的更一般属性,而非迎合数据集特定的怪异性。本质上,我们提出的模型学会了遗忘数据集偏置。

关键词

引用

@article{arxiv.1812.01716,
  title  = {Learning to Unlearn: Building Immunity to Dataset Bias in Medical Imaging Studies},
  author = {Ahmed Ashraf and Shehroz Khan and Nikhil Bhagwat and Mallar Chakravarty and Babak Taati},
  journal= {arXiv preprint arXiv:1812.01716},
  year   = {2018}
}

备注

Machine Learning for Health (ML4H) Workshop at NeurIPS 2018 arXiv:1811.07216 Submission Id: 207