学会遗忘:在医学影像研究中构建对数据集偏置的免疫
计算机视觉与模式识别
2018-12-06 v1 机器学习
机器学习
摘要
医学影像机器学习算法通常在单一数据集上评估。尽管训练与测试在该数据集的不同子集上进行,但基于一项研究构建的模型泛化到其他研究的能力有限。尽管数据库偏置已被计算机视觉界视为严重问题,其在医学影像研究中在很大程度上仍未被察觉。因此,迁移学习仍局限于特征表示的重用,需要在新数据集上重新训练。结果,即便在针对同一感兴趣变量采集的影像数据集上训练,机器学习模型也无法泛化。若有可能,无需重新训练便将从一个研究汲取的知识迁移到另一研究,将令人确信模型学习的是所研究问题的基础性知识,而非拘泥于数据集的特异性。本文中,我们将数据集偏置问题置于医学影像研究的背景下。我们展示了此类问题存在于医学数据集中的经验证据。随后,我们提出一种遗忘研究归属的框架,作为处理数据库偏置问题的手段。我们的核心思想是,将数据从原始特征空间映射到中间空间,在该空间中数据点就其来源研究而言不可区分,同时保持对感兴趣变量的识别能力。这将促进模型学习所研究病因的更一般属性,而非迎合数据集特定的怪异性。本质上,我们提出的模型学会了遗忘数据集偏置。
引用
@article{arxiv.1812.01716,
title = {Learning to Unlearn: Building Immunity to Dataset Bias in Medical Imaging Studies},
author = {Ahmed Ashraf and Shehroz Khan and Nikhil Bhagwat and Mallar Chakravarty and Babak Taati},
journal= {arXiv preprint arXiv:1812.01716},
year = {2018}
}
备注
Machine Learning for Health (ML4H) Workshop at NeurIPS 2018 arXiv:1811.07216 Submission Id: 207