利用多模态推理推进对话式诊断人工智能
计算与语言
2025-05-09 v1 人工智能
计算机视觉与模式识别
机器学习
摘要
大型语言模型(LLMs)在开展诊断对话方面展现出巨大潜力,但评估大多局限于纯语言交互,偏离了远程医疗服务的实际需求。即时通讯平台允许临床医生和患者在上传和讨论多模态医学资料,但LLM在推理此类数据的同时保持合格诊断对话的其他属性的能力尚不清楚。在此,我们通过赋予Articulate Medical Intelligence Explorer(AMIE)收集和解释多模态数据并在咨询过程中对其进行精确推理的新能力,提升了其对话式诊断和管理性能。利用Gemini 2.0 Flash,我们的系统实现了一个状态感知对话框架,其中对话流程由反映患者状态和演变诊断的中间模型输出动态控制。后续问题由这些患者状态中的不确定性策略性地引导,从而形成一个更结构化的多模态病史采集过程,模拟经验丰富的临床医生。我们在一项随机、盲法、OSCE风格的研究中,将AMIE与初级保健医生(PCPs)在基于聊天的患者演员咨询中进行了比较。我们构建了105个评估场景,使用了跨不同条件和人口统计学的智能手机皮肤照片、心电图(ECGs)和临床文档PDF等资料。我们的评估标准涵盖了多模态能力以及其他临床上有意义的维度,如病史采集、诊断准确性、管理推理、沟通和同理心。专家评估显示,AMIE在7/9个多模态轴和29/32个非多模态轴(包括诊断准确性)上优于PCPs。结果显示了多模态对话式诊断AI的明显进步,但向真实世界的转化还需要进一步研究。
引用
@article{arxiv.2505.04653,
title = {Advancing Conversational Diagnostic AI with Multimodal Reasoning},
author = {Khaled Saab and Jan Freyberg and Chunjong Park and Tim Strother and Yong Cheng and Wei-Hung Weng and David G. T. Barrett and David Stutz and Nenad Tomasev and Anil Palepu and Valentin Liévin and Yash Sharma and Roma Ruparel and Abdullah Ahmed and Elahe Vedadi and Kimberly Kanada and Cian Hughes and Yun Liu and Geoff Brown and Yang Gao and Sean Li and S. Sara Mahdavi and James Manyika and Katherine Chou and Yossi Matias and Avinatan Hassidim and Dale R. Webster and Pushmeet Kohli and S. M. Ali Eslami and Joëlle Barral and Adam Rodman and Vivek Natarajan and Mike Schaekermann and Tao Tu and Alan Karthikesalingam and Ryutaro Tanno},
journal= {arXiv preprint arXiv:2505.04653},
year = {2025}
}