BIMCV-R:用于3D CT文本-图像检索的里程碑数据集
计算机视觉与模式识别
2024-07-19 v2 计算与语言
摘要
3D医学成像在医疗保健中的迅速整合导致医疗专业人员的工作量大幅增加。为了协助临床医生的诊断过程并减轻其工作量,开发一个用于检索类似病例研究的稳健系统是一个可行的解决方案。尽管这一概念前景广阔,但3D医学文本-图像检索领域目前因缺乏稳健的评估基准和精心整理的数据集而受到限制。为解决这一问题,我们的研究提出了一个开创性数据集{BIMCV-R},其中包含大量3D CT体积(共8,069个,超过200万张切片)及其对应的放射学报告。在数据集基础工作之上,我们设计了一种检索策略MedFinder。该方法采用双流网络架构,利用大型语言模型的潜力,推动医学图像检索领域超越现有的文本-图像检索解决方案。这是我们朝着开发能够实现文本到图像、图像到文本和基于关键词的检索任务的系统迈出的初步一步。我们的项目可在\url{https://huggingface.co/datasets/cyd0806/BIMCV-R}获取。
引用
@article{arxiv.2403.15992,
title = {BIMCV-R: A Landmark Dataset for 3D CT Text-Image Retrieval},
author = {Yinda Chen and Che Liu and Xiaoyu Liu and Rossella Arcucci and Zhiwei Xiong},
journal= {arXiv preprint arXiv:2403.15992},
year = {2024}
}