检测、量化并纳入数据集偏差:基于12,207个个体的神经影像学分析
计算机视觉与模式识别
2018-05-01 v1 人工智能
摘要
神经影像学数据集的规模不断扩大,以应对日益复杂的医学问题。然而,即使是当今最大的单一数据集,对于训练复杂模型或寻找全基因组关联而言也太小了。一种解决方案是通过合并多个数据集的数据来增加样本量。但是,数据集中的偏差使这种方法变得复杂,反而会在数据中引入额外的变异源。在这项工作中,我们合并了15个大型神经影像学数据集以研究偏差。首先,我们通过证明扫描数据能以 73.3% 的准确率被正确分配到其来源数据集来检测偏差。接着,我们引入了用于量化数据集间兼容性并创建神经影像站点嵌入的指标。最后,我们在为预测自闭症选择训练集时纳入了偏差因素。为了量化数据集偏差,我们引入了两个指标:数据集间的 Bhattacharyya 距离和年龄预测误差。所提出的神经影像站点嵌入提供了关于不同站点相似性的有趣新可视化。这可用于指导数据源的合并,同时限制不必要变异的引入。最后,我们证明了在自闭症预测的训练集选择中纳入数据集偏差可带来明显的性能提升。总体而言,我们认为不断增长的神经影像学数据要求在未来的分析中采用数据驱动的方法来量化数据集偏差。
引用
@article{arxiv.1804.10764,
title = {Detect, Quantify, and Incorporate Dataset Bias: A Neuroimaging Analysis on 12,207 Individuals},
author = {Christian Wachinger and Benjamin Gutierrez Becker and Anna Rieckmann},
journal= {arXiv preprint arXiv:1804.10764},
year = {2018}
}