中文

OphIn-500K:策划用于扩展眼科多模态大语言模型的网络规模视觉指令

计算机视觉与模式识别 2026-05-28 v1 计算与语言

摘要

通用医学多模态大语言模型(MLLM)的进步显示出构建对话助手以支持临床诊断的巨大潜力。然而,它们在高度专业化领域(如眼科)的适应仍未被充分探索,这主要是由于缺乏大规模、领域特定的指令微调数据。现有的用于对话代理的眼科数据集通常在规模上受限,并且很大程度上依赖于来自已建立的公共基准的图像,限制了眼科MLLM的可扩展性及其捕捉真实世界临床复杂性的能力。为了解决这一差距,我们提出了OphIn-Engine\textbf{OphIn-Engine},一个眼科特定的指令数据整理流水线,它从开放获取的眼科网络规模视频中构建高质量的指令数据。该流水线集成了用于提取图像-文本对的多模态转录、用于识别临床相关视觉描述的视觉线索分离与评分,以及用于生成准确且多样化的临床对话的指令合成与质量控制。利用这个引擎,我们引入了OphIn-500K\textbf{OphIn-500K},一个大规模的多模态眼科指令微调数据集,包含超过50万个指令实例和来自超过29000个视频片段的超过151000张独特图像,格式化为视觉问答(VQA)、多轮对话交互和思维链(CoT)推理。基于此数据集,我们进一步开发了OphIn-VL\textbf{OphIn-VL},一个具有先进视觉理解和对话能力的眼科特定MLLM。全面的实验和案例研究表明,与最先进的通用医学和领域特定MLLM相比,OphIn-VL取得了优越的性能。

关键词

引用

@article{arxiv.2605.27916,
  title  = {OphIn-500K: Curating Web-Scale Visual Instructions for Scaling Ophthalmic Multimodal Large Language Models},
  author = {Xuanzhao Dong and Wenhui Zhu and Xiwen Chen and Hao Wang and Xin Li and Yujian Xiong and Jiajun Cheng and Jingjing Wang and Xiaobing Yu and Haiyu Wu and Shao Tang and Zhipeng Wang and Langechuan Liu and Shan Lin and Oana Dumitrascu and Yalin Wang},
  journal= {arXiv preprint arXiv:2605.27916},
  year   = {2026}
}