构建眼科 AI 跨越:MM-Retinal-Reason 数据集与 OphthaReason 模型通向动态多模态推理
人工智能
2025-09-11 v2
摘要
多模态大语言模型(Multimodal Large Language Model, MLLM)最近在强化学习范式下展现出惊人的推理能力。尽管已探索多种多模态推理模型,但大多数仅聚焦于基础推理,即基于视觉特征匹配的浅层推断。然而,真实世界临床诊断超越了基础推理,要求将异构临床信息(如主诉和病史)与多模态医学影像数据相结合的推理过程。为填补这一差距,我们引入 MM-Retinal-Reason,首个涵盖感知与推理全谱系的眼科多模态数据集,旨在增强视觉中心基础推理能力并模拟真实临床思维模式。基于 MM-Retinal-Reason,我们提出 OphthaReason,首个面向眼科的多模态推理模型,配有逐步推理痕迹。为实现对基础与复杂推理任务的灵活适应,我们特别设计了一种新方法,称为不确定性感知式动态思考(Uncertainty-Aware Dynamic Thinking, UADT),通过熵估计样本级不确定性,并利用有形优势机制动态调制模型的探索深度。全面实验表明,我们的模型在两类推理任务上均实现了最先进的性能,分别以 24.92%、15.00%、21.20% 和 17.66% 的优势超越通用 MLLM、医学 MLLM、基于 RL 的医学 MLLM和眼科 MLLM。项目页面: \href{https://github.com/lxirich/OphthaReason}{link}。
引用
@article{arxiv.2508.16129,
title = {Bridging the Gap in Ophthalmic AI: MM-Retinal-Reason Dataset and OphthaReason Model toward Dynamic Multimodal Reasoning},
author = {Ruiqi Wu and Yuang Yao and Tengfei Ma and Chenran Zhang and Na Su and Tao Zhou and Geng Chen and Wen Fan and Yi Zhou},
journal= {arXiv preprint arXiv:2508.16129},
year = {2025}
}