评估可解释人工智能在唤醒诊断中的实际应用效用:基于应用情境的用户研究
机器学习
2025-10-27 v1 人工智能
人机交互
摘要
人工智能(AI)系统日益匹配或超越人类专家在生物医学信号解读方面的能力。然而,其有效地融入临床实践需要超过高预测准确率。临床医生必须判断何时以及为何信任算法性建议。本文提出了一项应用导向的用户研究,针对八位专业睡眠医学从业者进行研究,他们在三种条件下对夜间唤醒事件进行评分:(i)手动评分,(ii)黑盒(BB)AI辅助,(iii)透明的白盒(WB)AI辅助。提供帮助的方式是从评分开始时,或作为事后质量控制(QC)复审。我们系统评估了帮助类型和时机如何影响事件级别和临床最相关的计数性能、时间要求和用户体验。在被用于训练AI的临床标准上评估时,AI和人机团队均显著优于未受帮助的专家,合作还能减少评估者之间的变异性。值得注意的是,透明AI辅助作为针对性QC步骤应用,约比黑盒辅助提高约30%的事件级别性能,QC时机进一步提升计数性能。尽管WB和QC方法增加了评分所需的时间,但起始时帮助更快,受众更青睐。参与者几乎全部表达了对透明度的偏好,其中七位受访者表示愿意接受该系统,仅需轻微或无需修改。总之,策略性时机的透明AI辅助有效地平衡了准确性和临床效率,为可信赖的AI集成及其在临床工作流程中的用户接受提供了可前景的道路。
引用
@article{arxiv.2510.21389,
title = {Assessing the Real-World Utility of Explainable AI for Arousal Diagnostics: An Application-Grounded User Study},
author = {Stefan Kraft and Andreas Theissler and Vera Wienhausen-Wilke and Gjergji Kasneci and Hendrik Lensch},
journal= {arXiv preprint arXiv:2510.21389},
year = {2025}
}