PathMMU:一个用于病理学理解与推理的大规模多模态专家级基准
计算机视觉与模式识别
2024-03-21 v3
摘要
大型多模态模型的出现释放了人工智能的巨大潜力,尤其是在病理学领域。然而,缺乏专门的、高质量的基准阻碍了它们的发展和精确评估。为了解决这个问题,我们引入了PathMMU,这是针对大型多模态模型(LMMs)的最大、最高质量且经过专家验证的病理学基准。它包含来自各种来源的33,428个多模态多选题和24,067张图像,每道题都附有正确答案的解释。PathMMU的构建利用了GPT-4V的先进能力,通过级联过程,利用超过30,000个图像-标题对来丰富标题并生成相应的问答对。值得注意的是,为了最大化PathMMU的权威性,我们邀请了七位病理学家按照严格标准仔细审查PathMMU验证集和测试集中的每个问题,同时为PathMMU设定了一个专家级性能基准。我们进行了广泛的评估,包括对14个开源和4个闭源LMM的零样本评估及其对图像损坏的鲁棒性。我们还对代表性的LMM进行了微调,以评估它们对PathMMU的适应性。实证结果表明,先进的LMM在具有挑战性的PathMMU基准上表现挣扎,表现最好的LMM GPT-4V仅达到了49.8%的零样本性能,显著低于人类病理学家展示的71.8%。微调后,规模小得多的开源LMM可以超越GPT-4V,但仍不及病理学家展示的专业水平。我们希望PathMMU能够提供有价值的见解,并促进开发更专业、下一代病理学LMM。
引用
@article{arxiv.2401.16355,
title = {PathMMU: A Massive Multimodal Expert-Level Benchmark for Understanding and Reasoning in Pathology},
author = {Yuxuan Sun and Hao Wu and Chenglu Zhu and Sunyi Zheng and Qizi Chen and Kai Zhang and Yunlong Zhang and Dan Wan and Xiaoxiao Lan and Mengyue Zheng and Jingxiong Li and Xinheng Lyu and Tao Lin and Lin Yang},
journal= {arXiv preprint arXiv:2401.16355},
year = {2024}
}
备注
27 pages, 12 figures