医学影像诊断中多模态AI模型的综合评估:从数据增强到基于偏好的比较
图像与视频处理
2024-12-10 v1 人工智能
计算与语言
计算机视觉与模式识别
摘要
本研究提出了一种用于医学影像诊断中多模态模型的评估框架。我们开发了一个包含数据预处理、模型推理和基于偏好的评估的流水线,通过受控增强将初始的500个临床病例扩展到3000个。我们的方法将医学影像与临床观察相结合以生成评估结果,使用Claude 3.5 Sonnet进行独立评估并与医生撰写的诊断结果进行对比。结果表明各模型性能存在差异,其中Llama 3.2-90B在85.27%的病例中优于人类诊断。相比之下,专用的视觉模型如BLIP2和Llava分别在41.36%和46.77%的病例中表现出偏好。本框架凸显了大型多模态模型在某些任务中超越人类诊断的潜力。
引用
@article{arxiv.2412.05536,
title = {Comprehensive Evaluation of Multimodal AI Models in Medical Imaging Diagnosis: From Data Augmentation to Preference-Based Comparison},
author = {Cailian Ruan and Chengyue Huang and Yahe Yang},
journal= {arXiv preprint arXiv:2412.05536},
year = {2024}
}