面向对话式医学 AI:拥有眼睛、耳朵与声音
人工智能
2026-05-12 v1 计算与语言
计算机视觉与模式识别
摘要
医学实践不仅依赖于技巧性的对话,还依赖于医生与患者之间关于声音和视觉线索的细致交互与解读。基于 Gemini 的低延迟语音与视频处理能力,我们引入 AI 共医生系统——首个集成实时患者对话中连续音视频数据以指导临床决策的对话式 AI 系统。其双代理构在深入临床推理与实现自然对话所需的低延迟之间取得平衡。为评估该系统,我们实现了一个基于视频的界面,模拟远程医疗咨询。我们设计了 20 套标准化门诊情景,要求主动进行实时听觉与视觉推理,并制定了“TelePACES”评估标准及情景特定评分表。在随机、界面隐蔽的交叉实验研究中(共 120 场对话),我们将 AI 共医生与 primary care physicians(主治医生)、GPT-Realtime 以及基线代理进行比较。AI 共医生在 TelePACES 关键维度(包括诊疗计划和鉴别诊断)上接近主治医生水平,但在所有一般性评估标准上显著优于 GPT-Realtime。尽管本代理在情景特定分流措施上与主治医生持平,但医生在情景特定评估中的整体表现仍然优异。尽管 AI 共医生标志着实时远程医疗 AI 的重大进步,但在体格检查和疾病特定推理方面仍存在差距。我们的工作表明,文本-only 方法无法捕捉医学咨询的真实挑战,表明高风险实时诊断 AI 最安全的推进路径是协作式、三方模型,使 AI 能成为医生与患者之间的支持性共医生。
引用
@article{arxiv.2605.09272,
title = {Towards Conversational Medical AI with Eyes, Ears and a Voice},
author = {Meet Shah and Jason Gusdorf and Anil Palepu and Chunjong Park and Jack W. O'Sullivan and Vishnu Ravi and Tim Strother and Pavel Dubov and Aliya Rysbek and Toshiyuki Fukuzawa and Yana Lunts and Jan Freyberg and Michael B. Chang and Aniruddh Raghu and David Stutz and Devora Berlowitz and Eliseo Papa and Taylan Cemgil and JD Velasquez and Jack Chen and Arthur Chen and Doug Fritz and Charlie Taylor and Katya Tregubova and Jing Rong Lim and Richard Green and Sara Mahdavi and Mahvish Nagda and Jihyeon Lee and Craig Schiff and Liviu Panait and Sukhdeep Singh and Valentin Liévin and David G. T. Barrett and Hannah Gladman and Anna Cupani and Francesca Pietra and Uchechi Okereke and Katherine Tong and Clemens Meyer and Erwan Rolland and Mili Sanwalka and Michael D. Howell and Shixiang Shane Gu and Bibo Xu and Euan A. Ashley and S. M. Ali Eslami and Gregory Wayne and Pushmeet Kohli and Vivek Natarajan and Adam Rodman and Alan Karthikesalingam and Ryutaro Tanno},
journal= {arXiv preprint arXiv:2605.09272},
year = {2026}
}
备注
Video examples are available on Youtube: https://youtu.be/y5Vaa_SN1t0, https://youtu.be/dC4icb75vLQ, and https://youtu.be/E7iEvWo-E6c