中文

SemiHVision:通过半人类注释数据集和微调指令生成,提升医学多模态模型性能

计算与语言 2024-10-22 v1 计算机视觉与模式识别

摘要

多模态大语言模型(Multimodal Large Language Models, MLLMs)取得了显著进展,但在医学领域面临知识有限的挑战。虽然最近的医学 MLLMs 在实验室环境中表现出色,但往往在实际应用中挣扎,凸显了研究与实践之间的显著差距。本文旨在在整个学习管道的各个阶段缓解这一差距,包括数据收集、模型微调和评估。在数据收集阶段,我们引入了 SemiHVision 数据集,该数据集结合了人类注释和自动数据增强技术,以提高医学知识表征和诊断推理能力。在模型微调阶段,我们在超过2400个 H100 GPU 小时上训练了 PMC-Cambrian-8B-AN,模型性能超过了公共医学模型如 HuatuoGPT-Vision-34B(79.0% vs. 66.7%)和私有通用模型如 Claude3-Opus(55.7%),在传统基准测试如 SLAKE 和 VQA-RAD 上取得显著成绩。在评估阶段,我们发现传统基准测试无法准确反映现实临床任务能力。为克服这一限制并为模型评估提供更有针对性的指导,我们引入了 JAMA Clinical Challenge,这是一个专门用于评估诊断推理的新型基准测试。在该基准测试上,PMC-Cambrian-AN 实现了最佳性能,获得 GPT-4 评分 1.29,显著优于 HuatuoGPT-Vision-34B(1.13)和 Claude3-Opus(1.17),展示了其在诊断推理方面的优越能力。

关键词

引用

@article{arxiv.2410.14948,
  title  = {SemiHVision: Enhancing Medical Multimodal Models with a Semi-Human Annotated Dataset and Fine-Tuned Instruction Generation},
  author = {Junda Wang and Yujan Ting and Eric Z. Chen and Hieu Tran and Hong Yu and Weijing Huang and Terrence Chen},
  journal= {arXiv preprint arXiv:2410.14948},
  year   = {2024}
}