站在 FURM 基础之上——面向医疗系统中公平、可靠且有用的 AI 模型评估框架
计算机与社会
2024-03-18 v2 人工智能
摘要
使用人工智能(AI)指导患者护理或运营过程的影响是 AI 模型输出、基于该输出的决策协议以及参与者执行必要后续行动能力之间的相互作用。估计此相互作用在部署前的效果,以及事后实时研究,对于搭建 AI 模型开发与可实现效益之间的鸿沟至关重要。为此,斯坦福健康护理数据科学团队开发了一种测试与评估(T&E)机制,以识别公平、可靠且有用的 AI 模型(FURM),通过进行伦理审查以识别潜在的价值不匹配,进行仿真以估计有用性,进行财务预测以评估可持续性,以及进行分析以确定 IT 可行性、设计部署策略,并提出前瞻性监控和评估计划。我们报告了对六个 AI 指导解决方案进行的 FURM 评估,以评估其潜在采纳,涵盖临床和运营场景,每项解决方案的潜在影响范围从数十人到数万人不等。我们描述了评估过程、总结了六次评估,并分享了我们的框架,以便他人能够进行类似的评估。我们评估的六个解决方案中,有两个已进入计划和实施阶段。我们的新型贡献——通过仿真获得有用性估计、通过财务预测量化可持续性,以及进行伦理评估的过程——以及其 underlying 方法和开源工具,均可供其他医疗系统进行可操作的 AI 解决方案评估。
引用
@article{arxiv.2403.07911,
title = {Standing on FURM ground -- A framework for evaluating Fair, Useful, and Reliable AI Models in healthcare systems},
author = {Alison Callahan and Duncan McElfresh and Juan M. Banda and Gabrielle Bunney and Danton Char and Jonathan Chen and Conor K. Corbin and Debadutta Dash and Norman L. Downing and Sneha S. Jain and Nikesh Kotecha and Jonathan Masterson and Michelle M. Mello and Keith Morse and Srikar Nallan and Abby Pandya and Anurang Revri and Aditya Sharma and Christopher Sharp and Rahul Thapa and Michael Wornow and Alaa Youssef and Michael A. Pfeffer and Nigam H. Shah},
journal= {arXiv preprint arXiv:2403.07911},
year = {2024}
}