中文

检测并校正多站点神经影像数据集中的偏倚

计算机视觉与模式识别 2020-10-29 v2 机器学习 图像与视频处理

摘要

训练复杂机器学习算法以及在关联研究中增加统计功效的需求推动神经影像研究使用越来越大的数据集。增加样本量最显而易见的方式是合并独立研究的扫描数据。然而,简单合并通常不可取,因为选择偏倚、测量偏倚和混杂偏倚可能潜入并产生虚假相关。本工作中,我们合并了来自 17 个研究的 35,320 张脑部磁共振图像以检验神经影像中的偏倚。在第一个实验“认出那个数据集”中,我们通过展示扫描数据能以 71.5% 准确率被正确归至各自数据集,提供了偏倚存在的经验证据。鉴于此类证据,我们仔细考察了常被视作观察性研究主要缺陷的混杂偏倚。实践中,我们既不知道所有潜在混杂因素,也没有关于它们的数据。因此,我们将混杂因素建模为未知的潜变量。随后利用 Kolmogorov 复杂度来判断混杂模型还是因果模型给出了图模型更简单的分解。最后,我们提出数据集协调方法并研究其去除影像特征中偏倚的能力。特别地,受遗传学中调整群体分层启发,我们提出近期引入的 ComBat 算法的扩展以控制图像特征间的全局变异。我们的结果表明协调能减少图像特征中数据集特有信息。此外,混杂偏倚可被削减甚至转化为因果关系。然而,协调也需谨慎,因其易移除相关的受试者特定信息。代码见 https://github.com/ai-med/Dataset-Bias。

关键词

引用

@article{arxiv.2002.05049,
  title  = {Detect and Correct Bias in Multi-Site Neuroimaging Datasets},
  author = {Christian Wachinger and Anna Rieckmann and Sebastian Pölsterl},
  journal= {arXiv preprint arXiv:2002.05049},
  year   = {2020}
}