SymptomAI:迈向用于日常症状评估的对话式 AI 智能体
人工智能
2026-05-12 v2
摘要
语言模型在精心整理的医学案例和简短病历上表现出色,其诊断评估水平与临床专业人员相当甚至更优。然而,现有研究多聚焦于具有丰富上下文的复杂场景,难以推断这些系统在患者报告日常症状时的表现。我们通过 Fitbit 应用部署了 SymptomAI——一组用于端到端患者访谈和鉴别诊断(DDx)的对话式 AI 智能体,在一项将参与者(N=13,917)随机分配与五个 AI 智能体交互的研究中进行了测试。该语料库捕捉了真实世界人群中的多样化沟通方式和真实的疾病分布。其中 1,228 名参与者报告了临床医生提供的诊断,其中 517 例由一组临床医生在超过 250 小时的标注过程中进行了进一步评估。在盲法随机比较中,给定相同的对话,SymptomAI 的 DDx 明显比独立临床医生的诊断更准确(OR = 2.56, p < 0.001)。此外,在提供诊断前进行专门的症状访谈以获取额外症状信息的智能体策略,其表现显著优于基线的用户引导式对话(p < 0.001)。对来自美国普通人群小组的 1,509 段对话的辅助分析验证了这些结果可推广至可穿戴设备用户之外的人群。我们使用 SymptomAI 的诊断作为所有 13,917 名参与者的标签,分析了近 400 种独特疾病状况下超过 500,000 天的可穿戴设备指标。我们发现了急性感染与生理变化之间的强关联(例如,流感的 OR > 7)。尽管受限于自我报告的真实标签,这些结果证明了与大多数消费级 LLM 默认的用户引导式症状讨论相比,专门且完整的症状访谈具有优势。
引用
@article{arxiv.2605.04012,
title = {SymptomAI: Toward a Conversational AI Agent for Everyday Symptom Assessment},
author = {Joseph Breda and Fadi Yousif and Beszel Hawkins and Marinela Cotoi and Miao Liu and Ray Luo and Po-Hsuan Cameron Chen and Mike Schaekermann and Samuel Schmidgall and Xin Liu and Girish Narayanswamy and Samuel Solomon and Maxwell A. Xu and Xiaoran Fan and Longfei Shangguan and Anran Wang and Bhavna Daryani and Buddy Herkenham and Cara Tan and Mark Malhotra and Shwetak Patel and John B. Hernandez and Quang Duong and Yun Liu and Zach Wasson and Dimitrios Antos and Bob Lou and Matthew Thompson and Jonathan Richina and Anupam Pathak and Nichole Young-Lin and Jake Sunshine and Daniel McDuff},
journal= {arXiv preprint arXiv:2605.04012},
year = {2026}
}
备注
13 page main text, 54 pages total. 16 figures total