数据集偏差的潜在来源使机器学习算法欠诊断的探究复杂化
人工智能
2023-07-07 v2 机器学习
摘要
越来越多的报告担忧机器学习算法可能因训练数据中嵌入的偏差而放大健康不平等。Seyyed-Kalantari 等人发现,在三个胸部 X 射线数据集上训练的模型在“无发现”标签(指示无疾病)上跨子组产生假阳性率(FPR)差异。模型在历史欠服务子组上一致产生更高 FPR,该研究得出结论:模型表现出并可能甚至放大系统性欠诊断。我们认为该研究的实验设定不足以研究算法欠诊断。在缺乏关于数据集偏差程度与性质的具体知识(或假设)时,难以探究模型偏差。重要的是,其使用与训练数据呈现相同偏差的测试数据(由于随机划分)严重复杂化了所报告差异的解释。
引用
@article{arxiv.2201.07856,
title = {Potential sources of dataset bias complicate investigation of underdiagnosis by machine learning algorithms},
author = {Mélanie Bernhardt and Charles Jones and Ben Glocker},
journal= {arXiv preprint arXiv:2201.07856},
year = {2023}
}
备注
Published as Matters Arising in Nature Medicine