CheXpert Plus:用文本放射学报告、患者人口统计信息和额外图像格式增强大型胸部X光数据集
计算与语言
2024-06-05 v2 人工智能
计算机视觉与模式识别
机器学习
摘要
自五年前原始CheXpert论文发布以来,CheXpert已成为最广泛使用和引用的临床AI数据集之一。视觉语言模型的出现引发了对共享与CheXpert图像相关的报告的需求增加,同时AI公平性研究人员对获取人口统计数据兴趣日益增长。为此,CheXpert Plus作为新的放射学数据源集合,公开可用,以增强放射学领域所有后续机器学习任务的模型扩展性、性能、鲁棒性和公平性。CheXpert Plus是放射学领域公开发布的最大文本数据集,总计3600万文本标记,包括1300万印象标记。据我们所知,它代表了放射学领域最大的文本去标识化工作,匿名化了近100万个PHI跨度。这是放射学领域第二次发布大规模英文配对数据集,从而首次实现大规模跨机构训练。所有报告均与DICOM格式的高质量图像配对,以及大量图像和患者元数据,涵盖各种临床和社会经济群体,以及许多病理标签和RadGraph注释。我们希望该数据集能促进AI模型研究,进一步帮助放射科医生并改善医疗护理。数据可在以下URL获取:https://stanfordaimi.azurewebsites.net/datasets/5158c524-d3ab-4e02-96e9-6ee9efc110a1 模型可在以下URL获取:https://github.com/Stanford-AIMI/chexpert-plus
引用
@article{arxiv.2405.19538,
title = {CheXpert Plus: Augmenting a Large Chest X-ray Dataset with Text Radiology Reports, Patient Demographics and Additional Image Formats},
author = {Pierre Chambon and Jean-Benoit Delbrouck and Thomas Sounack and Shih-Cheng Huang and Zhihong Chen and Maya Varma and Steven QH Truong and Chu The Chuong and Curtis P. Langlotz},
journal= {arXiv preprint arXiv:2405.19538},
year = {2024}
}
备注
13 pages Updated title