推动生物医学高分辨率视觉-语言模型的发展
计算与语言
2024-06-17 v1 人工智能
计算机视觉与模式识别
定量方法
摘要
多模态学习显著推动了生成式人工智能的发展,尤其是在视觉-语言建模方面。诸如 GPT-4V 和开源项目如 LLaVA 等创新措施,使能够实现零样本任务完成的强大对话式智能体成为可能。然而,将这些技术应用于生物医学领域存在独特挑战。近期诸如 LLaVA-Med 等项目开始使用大型数据集如 PMC-15M 进行生物医学情境下的指令调优。我们的研究在三个关键方面做出贡献:(i) 我们呈现了一个新的指令数据集,包含来自 Claude3-Opus 和 LLaMA3 70B 的医学图像-文本对;(ii) 我们提出了一种新颖的图像编码策略,利用层次表示来提高细粒度生物医学视觉理解;(iii) 我们开发了 Llama3-Med 模型,该模型在生物医学视觉问答基准测试中实现了零样本最先进性能,平均性能提升超过10%。这些进展为医疗专业人员提供了更准确和可靠的工具,弥合了当前多模态对话式智能体之间的差距,推动了医疗 AI 的进一步创新。
引用
@article{arxiv.2406.09454,
title = {Advancing High Resolution Vision-Language Models in Biomedicine},
author = {Zekai Chen and Arda Pekis and Kevin Brown},
journal= {arXiv preprint arXiv:2406.09454},
year = {2024}
}
备注
15 pages