RJUA-MedDQA:面向医学文档问答与临床推理的多模态基准
计算与语言
2024-02-26 v1 人工智能
应用统计
摘要
大语言模型(LLMs)和多模态大模型(LMMs)的最新进展在多种医学应用中显示出潜力,例如智能医疗诊断。尽管取得了令人印象深刻的结果,但我们发现现有基准并未反映真实医学报告的复杂性和专业深度推理能力。在这项工作中,我们引入了RJUA-MedDQA,一个医学专业领域的综合基准,它提出了多项挑战:全面解读不同挑战性布局中的图像内容、具备数值推理能力以识别异常指标,以及展示临床推理能力以基于医学背景提供疾病诊断、状态和建议的陈述。我们精心设计了数据生成流程,并提出了高效结构恢复标注(ESRA)方法,旨在恢复医学报告图像中的文本和表格内容。该方法显著提高了标注效率,使每位标注员的生产力翻倍,并在准确率上提升了26.8%。我们进行了广泛的评估,包括对5个能够解决中文医学问答任务的LMMs进行少样本评估。为了进一步探究当前LMMs的局限性和潜力,我们使用ESRA方法生成的图像-文本对一组强大的LLMs进行了对比实验。我们报告了基线的性能,并提供了几点观察:(1)现有LMMs的整体性能仍然有限;然而LMMs对低质量和多样结构图像的鲁棒性优于LLMs。(3)跨上下文和图像内容的推理面临重大挑战。我们希望这个基准能够帮助社区在多模态医学文档理解这些具有挑战性的任务上取得进展,并促进其在医疗保健中的应用。
引用
@article{arxiv.2402.14840,
title = {RJUA-MedDQA: A Multimodal Benchmark for Medical Document Question Answering and Clinical Reasoning},
author = {Congyun Jin and Ming Zhang and Xiaowei Ma and Li Yujiao and Yingbo Wang and Yabo Jia and Yuliang Du and Tao Sun and Haowen Wang and Cong Fan and Jinjie Gu and Chenfei Chi and Xiangguo Lv and Fangzhou Li and Wei Xue and Yiran Huang},
journal= {arXiv preprint arXiv:2402.14840},
year = {2024}
}
备注
15 pages, 13 figures