中文

面向可信人机协作的多模态可解释医学 AI 助手

计算机视觉与模式识别 2025-05-13 v1 计算与语言

摘要

通用医学 AI(GMAI)系统在生物医学感知任务中已展现出专家水平性能,但因多模态可解释性不足和预测能力欠佳,临床实用性受限。本文提出 XMedGPT,一个以临床医生为中心的多模态 AI 助手,集成文本和视觉可解释性,以支持透明且可信的医疗决策。XMedGPT 不仅生成准确的诊断和描述性输出,还将参考解剖部位锚定于医学影像中,弥合可解释性和临床可用性之间的关键鸿沟。为支持实际部署,我们引入可靠性指数机制,通过基于一致性的评估实现不确定性量化。我们在四个支柱上对 XMedGPT 进行验证:多模态可解释性、不确定性量化和prognostic 建模,以及严格的基准测试。该模型在 141 个解剖区域内实现 0.703 的 IoU,Kendall's tau-b 为 0.479,表明视觉理由与临床结果高度一致。对于不确定性估计,视觉问答任务的 AUC 为 0.862,放射学报告生成为 0.764。在肺癌和脑肿瘤的生存率和复发预测中,XMedGPT 相较于先前领先模型提升 26.9%,对比 GPT-4o 提升 25.0%。严格的基准测试覆盖 347 个数据集,涵盖 40 种影像模态,外部验证跨越 4 个解剖系统,显示出卓越的通用性,在域内评估中性能提升超过现有 GMAI 的 20.7%,在 11,530 例院内数据评估中提升 16.7%。综上所述,XMedGPT 代表了具身医学 AI 集成的重大进步,为多样化的医疗保健应用提供了可信且可扩展的支持。

关键词

引用

@article{arxiv.2505.06898,
  title  = {Multi-Modal Explainable Medical AI Assistant for Trustworthy Human-AI Collaboration},
  author = {Honglong Yang and Shanshan Song and Yi Qin and Lehan Wang and Haonan Wang and Xinpeng Ding and Qixiang Zhang and Bodong Du and Xiaomeng Li},
  journal= {arXiv preprint arXiv:2505.06898},
  year   = {2025}
}