中文

如何有效地让通用视觉语言模型通过观看公共教育视频学习医学知识?

计算机视觉与模式识别 2025-05-23 v2

摘要

公开的生物医学视频(如 YouTube 上的视频)为医学生提供了宝贵的教育资源。与标准机器学习数据集不同,这些视频是为人类学习者设计的,常常将医学影像与旁白、解释图表和情境性框架混合在一起。本文我们调查这些教育性强但非标准化且异构的视频是否能够有效教授通用领域的视觉语言模型生物医学知识。为此,我们引入了 OpenBiomedVi—a一个生物医学视频指令调优数据集,包含 1031 小时的视频-标题和 Q/A 对,通过多步骤的人类在环流程筛选而来。生物医学视频数据集稀缺,OpenBiomedVi 通过提供基于真实世界教育内容的指令式监督,填补了重要的空白。令人惊讶的是,尽管这些视频具有非正式和异构的性质,微调后的Qwen-2-VL模型在大多数基准测试上表现出显著的性能提升。2B 模型在视频任务上实现 98.7% 的提升,在图像任务上实现 71.2% 的提升,在文本任务上实现 0.2% 的提升。7B 模型在视频任务上显示出 37.09% 的提升,在图像任务上显示出 11.2% 的提升,与其相应的基础模型相比,在文本任务上出现轻微的 2.7% 下降。为解决缺乏标准化生物医学视频评估数据集的问题,我们还引入了两个新的经专家筛选的基准 MIMICEchoQA 和 SurgeryVideoQA。在这些基准上,2B 模型实现了 99.1% 和 98.1% 的提升,而 7B 模型显示出 22.5% 和 52.1% 的提升,表明这些模型能够在训练时看到的更清洁和更标准化的数据集上进行生物医学视频理解。这些结果表明,为人类学习而创建的教育视频意外地为生物医学视觉语言模型提供了有效的训练信号。

关键词

引用

@article{arxiv.2504.14391,
  title  = {How Well Can General Vision-Language Models Learn Medicine By Watching Public Educational Videos?},
  author = {Rahul Thapa and Andrew Li and Qingyang Wu and Bryan He and Yuki Sahashi and Christina Binder and Angela Zhang and Ben Athiwaratkun and Shuaiwen Leon Song and David Ouyang and James Zou},
  journal= {arXiv preprint arXiv:2504.14391},
  year   = {2025}
}