多模态医疗 AI:识别与设计放射学中具有临床相关性的视觉 - 语言应用
人机交互
2024-02-23 v1
摘要
AI 的最新进展将大型语言模型 (LLMs) 与视觉编码器相结合,带来了前所未有的技术能力,可用于广泛的医疗应用。聚焦于放射学领域,视觉 - 语言模型 (VLMs) 在诸如根据患者医学图像生成放射学发现或回答视觉问题(例如,'这张胸部 X 光片中的结节在哪里?')等任务中取得了良好的性能结果。然而,这些能力的潜在应用的临床实用性目前尚未得到充分探索。我们参与了一个迭代的跨学科设计过程,以构想具有临床相关性的 VLM 交互,并共同设计了四个 VLM 使用概念:报告草稿生成、增强型报告审查、视觉搜索与查询以及患者影像历史亮点。我们与 13 位放射科医生和临床医生一起研究了这些概念,他们评估认为 VLM 概念具有价值,但也提出了许多设计考量。反思我们的发现,我们讨论了在放射学中整合 VLM 能力的意义,以及对更广泛的医疗 AI 的启示。
引用
@article{arxiv.2402.14252,
title = {Multimodal Healthcare AI: Identifying and Designing Clinically Relevant Vision-Language Applications for Radiology},
author = {Nur Yildirim and Hannah Richardson and Maria T. Wetscherek and Junaid Bajwa and Joseph Jacob and Mark A. Pinnock and Stephen Harris and Daniel Coelho de Castro and Shruthi Bannur and Stephanie L. Hyland and Pratik Ghosh and Mercy Ranjit and Kenza Bouzid and Anton Schwaighofer and Fernando Pérez-García and Harshita Sharma and Ozan Oktay and Matthew Lungren and Javier Alvarez-Valle and Aditya Nori and Anja Thieme},
journal= {arXiv preprint arXiv:2402.14252},
year = {2024}
}
备注
to appear at CHI 2024