MedInsightBench:通过多步骤洞察发现评估医学分析智能体
人工智能
2025-12-16 v1 机器学习
摘要
在医学数据分析中,从复杂的多模态数据集中提取深层洞察对于提高患者护理、提高诊断准确率和优化医疗运营至关重要。然而,目前缺乏专为评估大型多模态模型(LMM)发现医学洞察能力而设计的高质量数据集。本文介绍 MedInsightBench,这是一个包含 332 个精心策划的医学案例的数据基准,每个案例都标注了精心设计的洞察。该基准旨在评估 LMM 和智能体框架分析多模态医学图像数据的能力,包括提出相关问题、解释复杂发现并综合可操作的洞察和建议。我们的分析表明,现有的 LMM 在 MedInsightBench 上表现有限,这主要归因于其在提取多步骤深层洞察方面的挑战以及缺乏医学专业知识。因此,我们提出 MedInsightAgent,一个用于医学数据分析的自动化智能体框架,由三个模块组成:视觉根查找器、分析洞察智能体和后续问题编撰器。在 MedInsightBench 上的实验结果表明,MedInsightAgent 能够显著提升通用 LMM 在医学数据洞察发现方面的性能。
引用
@article{arxiv.2512.13297,
title = {MedInsightBench: Evaluating Medical Analytics Agents Through Multi-Step Insight Discovery in Multimodal Medical Data},
author = {Zhenghao Zhu and Chuxue Cao and Sirui Han and Yuanfeng Song and Xing Chen and Caleb Chen Cao and Yike Guo},
journal= {arXiv preprint arXiv:2512.13297},
year = {2025}
}