中文

公共胸部放射摄影数据集用于人工智能的局限性:标签质量、域偏移、偏差与评估挑战

机器学习 2026-03-17 v2 数字图书馆

摘要

人工智能在胸部放射摄影领域已展现出显著潜力,深度学习模型可接近放射科医生水平的诊断性能。MIMIC-CXR、ChestX-ray14、PadChest和CheXpert等大型公共数据集的发布加速了进展,这些数据集提供了数十万张带有病理标注的图像。然而,这些数据集也存在重要局限。自动化标签提取会引入错误,特别是在处理不确定性和否定方面,且放射科医生审查经常与所分配标签不一致。此外,域偏移和人群偏差限制了模型的泛化能力,而评估实践往往忽略了临床上有意义的指标。我们对这些挑战进行了系统分析,重点关注标签质量、数据集偏差和域偏移。我们在多个模型架构上的跨数据集域偏移评估揭示了显著的外部性能下降,与内部测试相比,AUPRC和F1分数明显降低。为评估数据集偏差,我们训练了一个源分类模型,能够以接近完美的准确率区分数据集,并进行了子组分析,结果显示少数年龄和性别群体的性能下降。最后,两位持证放射科专家的审查发现公共数据集标签存在显著不一致。我们的发现揭示了当前基准的重要临床弱点,并强调了需要经过临床医生验证的数据集和更公平的评估框架。

关键词

引用

@article{arxiv.2509.15107,
  title  = {Limitations of Public Chest Radiography Datasets for Artificial Intelligence: Label Quality, Domain Shift, Bias and Evaluation Challenges},
  author = {Amy Rafferty and Ajitha Rajan},
  journal= {arXiv preprint arXiv:2509.15107},
  year   = {2026}
}