中文

面向 AI 临床评估的“碰撞测试假人”:用虚拟学习者验证虚拟患者场景

人机交互 2026-01-27 v1 人工智能 应用统计

摘要

背景:在医学与卫生专业教育(HPE)中,AI 越来越多地被用于评估临床能力,包括通过虚拟标准化患者进行评估。然而,大多数评估依赖于 AI-人类评分者间信度,缺乏关于病例、学习者与评分者如何共同塑造分数的测量框架。这使得稳健性不确定,并可能使学习者暴露于未经验证系统的误导。我们通过使用 AI “模拟学习者”在人类使用前对评估流水线进行压力测试与心理测量学表征来解决这个问题。目的:开发一个开源 AI 虚拟患者平台与测量模型,以在不同病例与评分条件下进行稳健的能力评估。方法:我们构建了一个平台,包含虚拟患者、具有可调 ACGME 对齐能力特征的虚拟学习者,以及使用结构化关键特征项对交互进行评分的多个独立 AI 评分者。使用贝叶斯 HRM-SDT 模型分析转录文本,该模型将评分视为不确定性下的决策,并分离学习者能力、病例表现与评分者行为;参数采用 MCMC 进行估计。结果:该模型恢复了模拟学习者的能力,尽管在非确定性流水线下,其与生成能力在所有 ACGME 领域均具有显著相关性。它按能力估计了病例难度,并显示使用相同模型/提示但不同随机种子的 AI 评分者具有稳定的评分者检测力(敏感度)与判定标准(严格/宽松阈值)。我们还提出了一种分阶段的“安全蓝图”,用于在学习者中部署 AI 工具,并将其与基于信任的验证里程碑相关联。结论:将专门构建的虚拟患者平台与严谨的心理测量模型相结合,能够实现稳健、可解释、可推广的能力估计,并支持在用于人类学习者之前对 AI 辅助评估进行验证。

关键词

引用

@article{arxiv.2601.18085,
  title  = {"Crash Test Dummies" for AI-Enabled Clinical Assessment: Validating Virtual Patient Scenarios with Virtual Learners},
  author = {Brian Gin and Ahreum Lim and Flávia Silva e Oliveira and Kuan Xing and Xiaomei Song and Gayana Amiyangoda and Thilanka Seneviratne and Alison F. Doubleday and Ananya Gangopadhyaya and Bob Kiser and Lukas Shum-Tim and Dhruva Patel and Kosala Marambe and Lauren Maggio and Ara Tekian and Yoon Soo Park},
  journal= {arXiv preprint arXiv:2601.18085},
  year   = {2026}
}