WangLab at MEDIQA-M3G 2024:使用大语言模型的多模态医学回答生成
计算与语言
2024-04-24 v1
摘要
本文概述了我们向 MEDIQA2024 多语言与多模态医学回答生成(M3G)共享任务提交的方案。我们报告了该任务英语类别下两种独立解决方案的结果:第一种涉及对 Claude 3 Opus API 的两次连续 API 调用,第二种涉及以 CLIP 风格训练图像-疾病标签联合嵌入用于图像分类。这两种方案在竞赛排行榜上分别位列第一和第二名,大幅超越了次优方案。此外,我们讨论了从赛后实验中获得的见解。尽管由于共享任务的难度以及医学视觉问答普遍具有的挑战性,这两种方案的性能仍有显著提升空间,但我们认为多阶段 LLM 方法和 CLIP 图像分类方法是值得进一步研究的有前景的途径。
引用
@article{arxiv.2404.14567,
title = {WangLab at MEDIQA-M3G 2024: Multimodal Medical Answer Generation using Large Language Models},
author = {Ronald Xie and Steven Palayew and Augustin Toma and Gary Bader and Bo Wang},
journal= {arXiv preprint arXiv:2404.14567},
year = {2024}
}