LLaVA-Ultra:面向超声影像的大型中文语言与视觉助手
计算机视觉与模式识别
2024-10-22 v1 人工智能
摘要
多模态大语言模型(MLLM)最近因能够利用强大的LLM,促成了从单调文本向执行多模态任务的对话式生成式AI的转变而备受关注。这一浪潮开始显著影响医疗领域。然而,通用视觉语言模型(VLM)缺乏对医学视觉问答(Med-VQA)的精细理解。即便是专为医疗领域定制的模型,也常产生模糊答案且视觉相关性较弱。本文提出了一种针对中文医学视觉对话的细粒度自适应VLM架构,通过参数高效调优实现。具体而言,我们设计了包含细粒度视觉编码器的融合模块,以实现对微妙医学视觉语义的增强。然后我们注意到,医疗场景中常见的数据冗余在大多数先前工作中被忽视。在文本仅对应多个图像的情况下,我们利用加权评分和知识蒸馏来自适应筛选有效图像,使其与文本描述相吻合。对于执行,我们利用来自医院的大规模多模态中文超声数据集。我们基于专业医生的文本创建指令遵循数据,确保有效调优。通过增强模型和高质量数据,我们的大型中文语言与视觉助手用于超声(LLaVA-Ultra)在医疗场景中展现出强大的能力和鲁棒性。在三个Med-VQA数据集上,LLaVA-Ultra在各种指标上超越了之前的最先进模型。
引用
@article{arxiv.2410.15074,
title = {LLaVA-Ultra: Large Chinese Language and Vision Assistant for Ultrasound},
author = {Xuechen Guo and Wenhao Chai and Shi-Yan Li and Gaoang Wang},
journal= {arXiv preprint arXiv:2410.15074},
year = {2024}
}