通过临床认知链推理构建用于定位-诊断协作的眼科多模态大语言模型
人工智能
2025-07-24 v1 计算机视觉与模式识别
图像与视频处理
摘要
多模态大语言模型(MLLM)在医学诊断领域展现出巨大潜力。然而,它们在眼科等专业领域面临关键挑战,特别是标注粒度的碎片化和临床推理逻辑的不一致性,这阻碍了精确的跨模态理解。本文介绍了FundusExpert,一个具有集成定位-诊断推理能力的眼科专用MLLM,以及FundusGen,一个通过智能Fundus-Engine系统构建的数据集。Fundus-Engine自动化定位,并利用基于MLLM的语义扩展,在单张眼底图像中整合全局疾病分类、局部目标检测和细粒度特征分析。此外,通过构建临床对齐的认知链,它引导模型生成可解释的推理路径。使用FundusGen的指令数据进行微调的FundusExpert,在眼科问答任务中取得了最佳性能,比40B MedRegA的平均准确率高出26.6%。它在零样本报告生成任务中也表现出色,临床一致性达到77.0%,显著优于GPT-4o的47.6%。此外,我们揭示了数据质量与模型能力之间的缩放定律(),表明FundusGen中的认知对齐注释提高了数据利用效率。通过将区域级定位与诊断推理链相结合,我们的工作开发了一个可扩展的、临床对齐的MLLM,并探索了一条弥合特定MLLM中视觉-语言鸿沟的途径。我们的项目可在https://github.com/MeteorElf/FundusExpert找到。
引用
@article{arxiv.2507.17539,
title = {Constructing Ophthalmic MLLM for Positioning-diagnosis Collaboration Through Clinical Cognitive Chain Reasoning},
author = {Xinyao Liu and Diping Song},
journal= {arXiv preprint arXiv:2507.17539},
year = {2025}
}