中文

STLLaVA-Med:用于医学问答的自训练大语言视觉助手

计算机视觉与模式识别 2024-10-28 v2 机器学习

摘要

大型视觉语言模型(LVLMs)在利用广泛的生物医学数据集辅助医学诊断方面展现出巨大的潜力。然而,医学图像理解和推理的进步严重依赖于构建高质量的视觉指令数据,而这在医学领域昂贵且耗时。为缓解这一数据匮乏问题,我们引入自训练大语言视觉助手用于医疗(STLLaVA-Med)。所提出的方法旨在训练一个策略模型(LVM),其能够自动生成医学视觉指令数据以提高数据效率,借助直接偏好优化(DPO)指导。具体而言,参与 DPO 微调过程的更强大且更大的 LVM(如 GPT-4o)作为生物医学专家,对其进行监督,以鼓励策略模型高效地与人类偏好一致。我们在三个主要医学视觉问答(VQA)基准测试中验证了 STLLaVA-Med 的有效性和数据效率,展示了仅使用 9% 医学数据即可实现具竞争力的零样本性能。

关键词

引用

@article{arxiv.2406.19973,
  title  = {STLLaVA-Med: Self-Training Large Language and Vision Assistant for Medical Question-Answering},
  author = {Guohao Sun and Can Qin and Huazhu Fu and Linwei Wang and Zhiqiang Tao},
  journal= {arXiv preprint arXiv:2406.19973},
  year   = {2024}
}

备注

EMNLP 2024 Main conference