中文

ROCOv2:放射学对象在语境中的版本 2,更新的多模态图像数据集

图像与视频处理 2024-06-19 v2 计算机视觉与模式识别 机器学习

摘要

自动化医学图像分析系统通常需要大量带高质量标签的训练数据,而这些标签的生成往往困难且耗时。本文介绍放射学对象在语境版本 2 (ROCOv2),这是一个由放射学图像及其提取的医学概念和标题组成的多模态数据集,数据来源于 PMC 公开获取的子集。它是 2018 年发布的 ROCO 数据集的更新版本,新增了 35,705 张自 2018 年来自 PMC 的新图像。数据集进一步提供了针对不同成像模态的人工策划的概念,以及针对 X 光片的额外解剖和方向概念。该数据集包含 79,789 张图像,已在 ImageCLEFmedical Caption 2023 的概念检测和标题预测任务中使用(可能经过轻微修改)。该数据集适用于基于图像标题对的图像注释模型训练,或使用随每张图像提供的统一医学语言系统 (UMLS) 概念进行多标签图像分类。此外,它还可用于医学领域模型的预训练,以及深度学习模型的多任务学习评估。

关键词

引用

@article{arxiv.2405.10004,
  title  = {ROCOv2: Radiology Objects in COntext Version 2, an Updated Multimodal Image Dataset},
  author = {Johannes Rückert and Louise Bloch and Raphael Brüngel and Ahmad Idrissi-Yaghir and Henning Schäfer and Cynthia S. Schmidt and Sven Koitka and Obioma Pelka and Asma Ben Abacha and Alba G. Seco de Herrera and Henning Müller and Peter A. Horn and Felix Nensa and Christoph M. Friedrich},
  journal= {arXiv preprint arXiv:2405.10004},
  year   = {2024}
}

备注

Accepted for Scientific Data