中文

MedMax: 用于训练生物医学助手的混合模态指令微调

人工智能 2025-04-24 v2 计算与语言 计算机视觉与模式识别

摘要

混合模态生成式的最新进展为开发统一的生物医学助手开辟了新途径,此类助手能够分析生物医学图像、回答关于这些图像的复杂问题,并生成多模态患者报告。然而,现有数据集面临规模小、生物医学任务和领域覆盖有限以及依赖单一来源等挑战。为了填补这些空白,我们提出了 MedMax,一个用于混合模态基础模型的大规模多模态生物医学指令微调数据集。MedMax 包含 147 万个实例,涵盖多种任务,包括交错图文生成、生物医学图像描述与生成、视觉聊天以及报告理解。这些任务涵盖了放射学和组织病理学等不同生物医学领域的知识,并以医学论文和 YouTube 视频为基础。随后,我们在 MedMax 数据集上微调了一个混合模态基础模型,取得了显著的性能提升:在 12 个下游生物医学视觉问答任务中,较 Chameleon 模型提升了 26%,较 GPT-4o 提升了 18.3%。最后,我们引入了一个用于生物医学任务的统一评估套件,以指导混合模态生物医学 AI 助手的发展。数据、模型和代码可在 https://mint-medmax.github.io/ 获取。

关键词

引用

@article{arxiv.2412.12661,
  title  = {MedMax: Mixed-Modal Instruction Tuning for Training Biomedical Assistants},
  author = {Hritik Bansal and Daniel Israel and Siyan Zhao and Shufan Li and Tung Nguyen and Aditya Grover},
  journal= {arXiv preprint arXiv:2412.12661},
  year   = {2025}
}

备注

29 pages