MC-CoT:面向零样本医学-VQA 的模块化协作链式思考框架
计算机视觉与模式识别
2024-10-08 v1
摘要
在最近的进展中,针对医学视觉问答(Med-VQA)任务,对特定医学图像数据集进行任务特定微调是一种常见做法,但这需要为每个下游任务构建独立模型,限制了零样本能力的探索。本文引入 MC-CoT,一个模块化跨模态协作链式思考(CoT)框架,旨在通过利用大型语言模型(LLM)来增强多模态大语言模型(MLLM)在 Med-VQA 中的零样本性能。MC-CoT 通过整合医学知识和任务特定指导来提高推理和信息提取,其中 LLM 提供各种复杂的医学推理链,而 MLLM 根据 LLM 的指令提供各种医学图像观察。我们的实验在 SLAKE、VQA-RAD 和 PATH-VQA 等数据集上表明,MC-CoT 在召回率和准确率方面优于独立的 MLLM 和各种多模态 CoT 框架。这些发现突显了在解决复杂零样本 Med-VQA 任务时,纳入背景信息和详细指导的重要性。
引用
@article{arxiv.2410.04521,
title = {MC-CoT: A Modular Collaborative CoT Framework for Zero-shot Medical-VQA with LLM and MLLM Integration},
author = {Lai Wei and Wenkai Wang and Xiaoyu Shen and Yu Xie and Zhihao Fan and Xiaojin Zhang and Zhongyu Wei and Wei Chen},
journal= {arXiv preprint arXiv:2410.04521},
year = {2024}
}
备注
21 pages, 14 figures, 6 tables