稀有事件识别的人工智能的批判性评估:原则与药事安全案例研究
机器学习
2025-10-07 v1 人工智能
摘要
许多高风险的人工智能应用针对的是低流行率事件,其中表观准确率可能掩盖其实际价值有限。相关人工智能模型范围从专家定义的规则和传统机器学习到受约束用于分类的生成式 LLM。我们概述了人工智能在稀有事件识别中进行批判性评估的关键考虑事项,包括问题框架和测试集设计、流行率感知的统计评估、鲁棒性评估以及集成到人类工作流程。此外,我们提出了一种结构化案例级检查方法 (SCLE),用于补充统计性能评估,并提出了一套综合性检查清单,以指导采购或开发稀有事件识别的人工智能模型。我们在药事安全领域实例化该框架,基于三个研究:基于规则的孕期相关报告检索;结合机器学习和概率记录链接的数据库重复检测;以及使用 LLM 自动删除人名。我们指出了稀有事件环境中特定的陷阱,包括来自不切实际的类别平衡和测试集中缺乏困难正例控制的乐观主义——并展示了如何通过代价敏感目标将模型性能与操作价值相匹配。虽然以药事安全实践为基础,但原则可推广到正样本稀少且错误成本可能不对称的领域。
引用
@article{arxiv.2510.04341,
title = {Critical appraisal of artificial intelligence for rare-event recognition: principles and pharmacovigilance case studies},
author = {G. Niklas Noren and Eva-Lisa Meldau and Johan Ellenius},
journal= {arXiv preprint arXiv:2510.04341},
year = {2025}
}
备注
28 pages, 2 figures