STLLaVA-Med:用于医学问答的自训练大语言视觉助手
计算机视觉与模式识别
2024-10-28 v2 机器学习
摘要
大型视觉语言模型(LVLMs)在利用广泛的生物医学数据集辅助医学诊断方面展现出巨大的潜力。然而,医学图像理解和推理的进步严重依赖于构建高质量的视觉指令数据,而这在医学领域昂贵且耗时。为缓解这一数据匮乏问题,我们引入自训练大语言视觉助手用于医疗(STLLaVA-Med)。所提出的方法旨在训练一个策略模型(LVM),其能够自动生成医学视觉指令数据以提高数据效率,借助直接偏好优化(DPO)指导。具体而言,参与 DPO 微调过程的更强大且更大的 LVM(如 GPT-4o)作为生物医学专家,对其进行监督,以鼓励策略模型高效地与人类偏好一致。我们在三个主要医学视觉问答(VQA)基准测试中验证了 STLLaVA-Med 的有效性和数据效率,展示了仅使用 9% 医学数据即可实现具竞争力的零样本性能。
引用
@article{arxiv.2406.19973,
title = {STLLaVA-Med: Self-Training Large Language and Vision Assistant for Medical Question-Answering},
author = {Guohao Sun and Can Qin and Huazhu Fu and Linwei Wang and Zhiqiang Tao},
journal= {arXiv preprint arXiv:2406.19973},
year = {2024}
}
备注
EMNLP 2024 Main conference