Med-Banana-50K:面向文本引导医学图像编辑的大规模跨模态数据集
计算机视觉与模式识别
2025-11-10 v3 多媒体
摘要
医学图像编辑已成为数据增强、模型可解释性、医学教育和治疗模拟等广泛应用领域的关键技术。然而,缺乏面向医学场景的大规模、高质量且公开获取的数据集,这些数据集在解剖和临床约束下运行,严重阻碍了该领域的进展。为弥合这一差距,我们引入了 Med-Banana-50K,这是一个涵盖胸部X光、脑部MRI和眼底照相术的综合性数据集,覆盖23种疾病,包含超过5万个经过医学审核的图像编辑。每个样本支持双向病灶编辑(添加和移除),并基于真实临床图像使用 Gemini-2.5-Flash-Image 进行构建。我们数据集的关键不同点在于医学导向的质量控制方案:我们采用 LLM-as-Judge 评估框架,包括指令遵循性、结构合理性、图像真实性和保真度保持等标准,并在最多五轮迭代中进行持续优化。此外,Med-Banana-50K 包含约37,000个失败的编辑尝试及完整的评估日志,以支持偏好学习和对齐研究。通过提供大规模、医学严谨且完全文档化的资源,Med-Banana-50K 为开发和评估可靠的医学图像编辑系统奠定了关键基础。我们的数据集和代码已公开获取。[https://github.com/richardChenzhihui/med-banana-50k]
引用
@article{arxiv.2511.00801,
title = {Med-Banana-50K: A Cross-modality Large-Scale Dataset for Text-guided Medical Image Editing},
author = {Zhihui Chen and Mengling Feng},
journal= {arXiv preprint arXiv:2511.00801},
year = {2025}
}