中文

利用非专家标注扩充胸部 X 光数据集

计算机视觉与模式识别 2025-07-22 v3

摘要

医学图像分析中机器学习算法的发展需要扩充训练数据集。一种流行且经济高效的方法是从自由文本医学报告中自动提取标注,这主要是因为临床专家标注医学图像(如胸部 X 光)的成本高昂。然而,已有研究表明,由此得到的数据集易受偏差与捷径的影响。另一种增加数据集规模的策略是众包,这是通用计算机视觉中广泛采用的实践,在医学图像分析中也取得了一定成功。类似于众包,我们通过引入非专家标注来增强两个公开的胸部 X 光数据集。不过,我们并非使用诊断标签,而是以导管形式标注捷径。我们为 NIH-CXR14 收集了 3.5k 个胸管标注,并为 PadChest 中的四种不同导管类型收集了 1k 个标注,由此创建了 X 光中导管的非专家标注(NEATX)数据集。我们利用非专家标注训练了一个胸管检测器,该检测器对专家标签具有良好的泛化能力。此外,我们将我们的标注与专家提供的标注进行比较,显示出“中等”到“几乎完全一致”的一致性。最后,我们提出了一项病理一致性研究,以提高对真值标注质量的关注。我们在 Zenodo(https://zenodo.org/records/14944064)上提供数据集,代码见 https://github.com/purrlab/chestxr-label-reliability。

关键词

引用

@article{arxiv.2309.02244,
  title  = {Augmenting Chest X-ray Datasets with Non-Expert Annotations},
  author = {Veronika Cheplygina and Cathrine Damgaard and Trine Naja Eriksen and Dovile Juodelyte and Amelia Jiménez-Sánchez},
  journal= {arXiv preprint arXiv:2309.02244},
  year   = {2025}
}

备注

Medical Image Understanding and Analysis Conference - MIUA 2025