中文

用于审计与改进临床AI模型可靠性的自主智能体

人工智能 2025-07-09 v1

摘要

在临床实践中部署AI模型面临一个关键挑战:在基准测试中达到专家级性能的模型,在面对医学影像中的真实世界变化时可能会灾难性地失败。扫描仪硬件、光照或人口统计特征的微小变化都可能降低准确性,但目前,在部署前识别此类灾难性故障案例的可靠性审计是一个定制且耗时的过程。从业者缺乏可访问且可解释的工具来暴露和修复隐藏的故障模式。在此,我们介绍 ModelAuditor,一个自我反思的智能体,它能与用户对话,选择任务特定的指标,并模拟上下文相关的、临床相关的分布偏移。然后,ModelAuditor 生成可解释的报告,解释部署期间性能可能下降的程度,讨论具体的可能故障模式,并识别根本原因和缓解策略。我们在三个真实世界的临床场景——组织病理学中的机构间差异、皮肤病学中的人口统计偏移以及胸部X光摄影中的设备异质性——中的全面评估表明,ModelAuditor 能够正确识别最先进模型(如已建立的 SIIM-ISIC 黑色素瘤分类器)的上下文特定故障模式。其针对性建议可恢复在真实世界分布偏移下损失的 15-25% 的性能,显著优于基线模型和最先进的数据增强方法。这些改进通过多智能体架构实现,并在消费级硬件上于 10 分钟内执行,每次审计成本低于 0.50 美元。

关键词

引用

@article{arxiv.2507.05755,
  title  = {An autonomous agent for auditing and improving the reliability of clinical AI models},
  author = {Lukas Kuhn and Florian Buettner},
  journal= {arXiv preprint arXiv:2507.05755},
  year   = {2025}
}