VIDS:医学 AI 的经验证成像数据集标准
摘要
医学成像 AI 开发根本依赖于标注数据集,但现有标准在数据集结构、标注来源、质量文档和 ML 就绪性方面未能提供机器可强制的验证。DICOM 标准在单个研究层面标准化图像获取、存储和通信;BIDS 在神经成像研究数据集中组织一致的命名约定。但两者都未解决标注层面的问题,即谁在何时使用何种工具对何种内容进行标注,且标注质量如何达标。本文提出 VIDS(Verified Imaging Dataset Standard),一种开放规范,定义文件夹布局、文件命名、标注来源模式、质量文档以及两套从属档案下的21项机器可强制验证规则。VIDS 将 NIfTI 作为标准工作格式,同时保留 DICOM 元数据的 sidecar 文件以实现可追溯性,可导出到任何下游 ML 框架(nnU-Net、MONAI、COCO、平面 NIfTI),且不损失来源信息。定义了22个合规维度,对四个主要公开数据集——LIDC-IDRI、BraTS、CheXpert 和 Medical Segmentation Decathlon 进行基准测试。即使是广泛使用的数据集,也仅满足20-39%的这些维度,其中来源和质量文档是最大的系统性缺口。我们发布了 LIDC-Hybrid-100 作为100 受试者的 VIDS 合规参考 CT 数据集,包含来自四位放射科医生的共识分割掩码(平均两两 Dice 0.7765),在完全合规档案下通过21/21 项验证。VIDS 完全开源:规范使用 CC BY 4.0 授权,所有工具使用 Apache 2.0 授权,参考验证器已发布在 PyPI(pip install vids-validator),LIDC-Hybrid-100 发布在 Zenodo(https://doi.org/10.5281/zenodo.19582717)。
引用
@article{arxiv.2604.17525,
title = {VIDS: A Verified Imaging Dataset Standard for Medical AI},
author = {Joan S. Muthu and John Shalen},
journal= {arXiv preprint arXiv:2604.17525},
year = {2026}
}
备注
11 pages, 3 figures, 5 tables