提升Gemini的多模态医学能力
计算机视觉与模式识别
2024-05-07 v1 人工智能
计算与语言
机器学习
摘要
许多临床任务需要理解专业数据,例如医学图像和基因组学,这些通常不在通用大型多模态模型的能力范围内。基于Gemini的多模态模型,我们在新的Med-Gemini系列中开发了多个模型,这些模型继承了Gemini的核心能力,并通过使用2D和3D放射学、组织病理学、眼科学、皮肤科学和基因组学数据的微调,针对医学应用进行了优化。Med-Gemini-2D在基于专家评估的AI胸部X光(CXR)报告生成方面树立了新标准,在两个独立数据集上分别以1%和12%的绝对幅度超越了之前的最佳结果,其中57%和96%的AI报告在正常病例中,以及43%和65%的AI报告在异常病例中,被评估为“等同于或优于”原始放射科医生的报告。我们首次展示了基于大型多模态模型的3D计算机断层扫描(CT)体积报告生成,使用Med-Gemini-3D,其中53%的AI报告被认为临床可接受,尽管需要进一步研究以达到专家放射科医生的报告质量。除了报告生成,Med-Gemini-2D在CXR视觉问答(VQA)中超越了之前的最佳性能,并在CXR分类和放射学VQA中表现良好,在20项任务中的17项上超过了最先进水平或基线。在组织病理学、眼科学和皮肤科学图像分类中,Med-Gemini-2D在20项任务中的18项上超越了基线,并接近任务特定模型的性能。在成像之外,Med-Gemini-Polygenic在疾病风险预测方面优于基于标准线性多基因风险评分的方法,并泛化到从未训练过的遗传相关疾病。尽管在安全关键的医学领域需要进一步开发和评估,我们的结果凸显了Med-Gemini在广泛医学任务中的潜力。
引用
@article{arxiv.2405.03162,
title = {Advancing Multimodal Medical Capabilities of Gemini},
author = {Lin Yang and Shawn Xu and Andrew Sellergren and Timo Kohlberger and Yuchen Zhou and Ira Ktena and Atilla Kiraly and Faruk Ahmed and Farhad Hormozdiari and Tiam Jaroensri and Eric Wang and Ellery Wulczyn and Fayaz Jamil and Theo Guidroz and Chuck Lau and Siyuan Qiao and Yun Liu and Akshay Goel and Kendall Park and Arnav Agharwal and Nick George and Yang Wang and Ryutaro Tanno and David G. T. Barrett and Wei-Hung Weng and S. Sara Mahdavi and Khaled Saab and Tao Tu and Sreenivasa Raju Kalidindi and Mozziyar Etemadi and Jorge Cuadros and Gregory Sorensen and Yossi Matias and Katherine Chou and Greg Corrado and Joelle Barral and Shravya Shetty and David Fleet and S. M. Ali Eslami and Daniel Tse and Shruthi Prabhakara and Cory McLean and Dave Steiner and Rory Pilgrim and Christopher Kelly and Shekoofeh Azizi and Daniel Golden},
journal= {arXiv preprint arXiv:2405.03162},
year = {2024}
}