用于多模态 X 射线成像和放射学报告生成的任意到任意视觉-语言模型
计算机视觉与模式识别
2026-02-16 v1 人工智能
摘要
生成模型已经彻底改变了人工智能(AI),特别是在多模态应用中。然而,由于医学数据的复杂性和对临床准确性的严格要求,将这些模型适应医学领域带来了独特的挑战。在这项工作中,我们引入了一个专门为多模态医学数据生成而设计的框架。通过实现多视图胸部 X 光片及其相关临床报告的生成,它弥合了通用视觉-语言模型与医疗保健专业化需求之间的差距。利用 MIMIC-CXR 数据集,所提出的框架在生成高保真图像和语义连贯的报告方面表现出优越的性能。我们的定量评估在 FID 和 BLEU 分数方面揭示了显著的结果,展示了生成数据的质量。值得注意的是,我们的框架在下游疾病分类任务上取得了与真实数据相当甚至更优的性能,突显了其作为医学研究和诊断工具的潜力。这项研究强调了领域特定适应在增强生成模型对临床应用的相关性和实用性方面的重要性,为合成多模态医学数据生成的未来发展铺平了道路。
引用
@article{arxiv.2505.01091,
title = {Any-to-Any Vision-Language Model for Multimodal X-ray Imaging and Radiological Report Generation},
author = {Daniele Molino and Francesco di Feola and Linlin Shen and Paolo Soda and Valerio Guarrasi},
journal= {arXiv preprint arXiv:2505.01091},
year = {2026}
}
备注
arXiv admin note: substantial text overlap with arXiv:2501.04614