领域自适应视觉与语言模型融合用于医学视觉问答
计算与语言
2024-04-26 v1 计算机视觉与模式识别
摘要
视觉语言模型在通用领域有效,并在多种多模态应用(如视觉问答(VQA))中表现出色,但在更专业的领域(如医学)中难以保持同样的有效性。我们提出了一种医学视觉语言模型,该模型集成了适应医学领域的大型视觉和语言模型。该模型使用三个独立的生物医学和放射学多模态视觉和文本数据集,经过三个阶段的高效参数训练。所提出的模型在SLAKE 1.0医学VQA(MedVQA)数据集上达到了最先进的性能,总体准确率为87.5%,并在另一个MedVQA数据集VQA-RAD上表现出强劲性能,总体准确率为73.2%。
引用
@article{arxiv.2404.16192,
title = {Fusion of Domain-Adapted Vision and Language Models for Medical Visual Question Answering},
author = {Cuong Nhat Ha and Shima Asaadi and Sanjeev Kumar Karn and Oladimeji Farri and Tobias Heimann and Thomas Runkler},
journal= {arXiv preprint arXiv:2404.16192},
year = {2024}
}
备注
Clinical NLP @ NAACL 2024