Dr-LLaVA: 具有符号临床基础的视觉指令微调
人工智能
2024-10-11 v2 计算与语言
计算机视觉与模式识别
机器学习
摘要
视觉语言模型(VLM)可以通过分析医学图像并进行自然语言交互来支持临床医生,协助诊断和治疗任务。然而,VLM经常表现出“幻觉”行为,生成未基于上下文多模态信息的文本输出。这一挑战在医学领域尤为突出,因为我们不仅要求VLM在单次交互中输出准确,还要求其在多轮对话中与临床推理和诊断路径保持一致。为此,我们提出了一种新的对齐算法,该算法使用临床推理的符号表示来将VLM基于医学知识。这些表示被用于(i)大规模生成GPT-4引导的视觉指令微调数据,模拟临床医生与VLM的对话并展示临床推理;(ii)创建自动奖励函数,评估VLM在临床医生-VLM交互中生成的临床有效性。我们的算法消除了在训练数据生成或奖励模型构建中需要人工参与的需求,与标准的人类反馈强化学习(RLHF)相比降低了成本。我们应用我们的对齐算法开发了Dr-LLaVA,一个用于分析骨髓病理切片的对话式VLM,在多轮医学对话中表现出色。
引用
@article{arxiv.2405.19567,
title = {Dr-LLaVA: Visual Instruction Tuning with Symbolic Clinical Grounding},
author = {Shenghuan Sun and Alexander Schubert and Gregory M. Goldgof and Zhiqing Sun and Thomas Hartvigsen and Atul J. Butte and Ahmed Alaa},
journal= {arXiv preprint arXiv:2405.19567},
year = {2024}
}
备注
Code available at: https://github.com/AlaaLab/Dr-LLaVA