中文

用因果推断量化神经影像数据集中的混杂偏差

机器学习 2019-07-10 v1 计算机视觉与模式识别 图像与视频处理 机器学习

摘要

神经影像数据集规模持续增长,以应对日益复杂的医学问题。然而,即便是当今最大的数据集单独来看也太小,无法训练复杂的机器学习模型。一个潜在的解决方案是通过合并多个数据集的扫描来增加样本量。在这项工作中,我们合并了来自 15 个研究的 12,207 张 MRI 扫描,并表明简单合并常不可取,因为会在训练数据中引入各类偏差。首先,我们系统地定义了这些偏差。其次,我们通过实验证明扫描可以其各自数据集被正确归类,准确率达 73.3%,从而检测出偏差。最后,我们提出通过使用因果推断量化单个数据集中混杂与因果的程度,来区分因果因素与混杂因素。我们通过寻找在 Kolmogorov 复杂度意义上最简单的图模型来实现这一点。由于 Kolmogorov 复杂度不可直接计算,我们采用最小描述长度来近似它。我们凭经验表明,我们的方法能够从真实神经影像数据中估计出合理的因果关系。

关键词

引用

@article{arxiv.1907.04102,
  title  = {Quantifying Confounding Bias in Neuroimaging Datasets with Causal Inference},
  author = {Christian Wachinger and Benjamin Gutierrez Becker and Anna Rieckmann and Sebastian Pölsterl},
  journal= {arXiv preprint arXiv:1907.04102},
  year   = {2019}
}

备注

MICCAI 2019