分解 HealthBench 医生不一致性
人工智能
2026-03-10 v2 应用统计
摘要
我们分解 HealthBench 医疗 AI 评估数据集中的医生不一致性,以理解方差居住于何处以及哪些可观察特征可以解释它。评级标识符解释了 15.8% 的是/否标签方差,但仅解释 3.6-6.9% 的不一致方差;医生标识符仅解释 2.4%。占主导的 81.8% 案例级残差未被 HealthBench 的元数据标签 (z = -0.22, p = 0.83)、规范评级语言 (伪 R^2 = 1.2%)、医学专科 (0/300 Tukey 配对显著)、表面特征分流 (AUC = 0.58) 或嵌入表示 (AUC = 0.485) 所减少。不一致性随完成质量呈倒 U 形 (AUC = 0.689),这表明医生在明显良好或差的输出上意见一致,但在边缘案例上意见分歧。医生验证的不确定性类别揭示,可减少的不确定性(缺失上下文、模糊措辞)使不一致性几乎翻倍 (OR = 2.55, p < 10^(-24)),而不可减少的不确定性(真正的医学模糊性)无显著影响 (OR = 1.01, p = 0.90),尽管前者仍仅解释约 3% 的总体方差。因此,医疗 AI 评估的一致性上限主要是结构性的,但可减少/不可减少的 dissocation 表明,在临床模糊性不显著时,闭合评估情景中的信息缺口可降低不一致性,这指向可操作的评估设计改进。
引用
@article{arxiv.2602.22758,
title = {Decomposing Physician Disagreement in HealthBench},
author = {Satya Borgohain and Roy Mariathas},
journal= {arXiv preprint arXiv:2602.22758},
year = {2026}
}