面向生成临床内容的 FMECA 框架开发与验证——评估大语言模型的患者安全风险
机器学习
2026-05-07 v1 人工智能
硬件体系结构
摘要
目标:大型语言模型 (LLM) 越来越多地用于临床文本摘要,但针对其关联患者安全风险的结构化评估方法仍寥寥。失效模式、影响及严重性分析 (FMECA) 提供了系统风险识别的前瞻框架,但尚未适用于 LLM 生成的临床内容。本研究旨在开发和验证一种新型 FMECA 框架,用于对 LLM 生成的临床摘要进行患者安全风险的前瞻性评估。材料与方法:由 8 名跨学科专家组成的专家小组通过文献综述和头脑风暴开发了失效模式分类。将标准 FMECA 维度 (发生频率、严重性、可检出性) 适应为 5 分制有序尺度。该框架被应用于来自四位患者的 36 份出院摘要,这些摘要由开源 LLM (GPT-OSS 120B) 使用日内瓦大学医院的真实临床数据生成。评审人员在两轮独立标注摘要。通过评估失效模式、严重性和可检出性评分水平的评审间一致性。使用适应的系统可用性尺度和结构化反馈评估了框架的可用性和内容效度。结果:最终框架包含 14 种失效模式,归类为若干类别。评审间一致性在两轮之间得到改善,失效模式识别达到中等至显著一致,严重性和可检出性评分达到良好一致。可用性评估为良好 (平均 SUS: 79.2/100),评估人员信心较高。讨论与结论:本研究首次提出基于 FMECA 的框架,用于系统性评估 LLM 生成的临床摘要的患者安全风险。该框架提供了一种结构化且可复现的方法,用于识别由这些摘要引起的临床相关风险。
引用
@article{arxiv.2605.04084,
title = {FASQ: Flexible Accelerated Subspace Quantization for Calibration-Free LLM Compression},
author = {Ye Qiao and Yian Wang and Zhiheng Chen and Hyoukjun Kwon and Sitao Huang},
journal= {arXiv preprint arXiv:2605.04084},
year = {2026}
}