中文

大型语言模型生成注释中的标签噪声对诊断模型性能评估的影响

统计方法学 2026-04-10 v1 应用统计

摘要

大型语言模型 (LLM) 越来越多地用于从放射报告生成标签,以实现大规模的人工智能评估。然而,来自大型语言模型的标签噪声可能会在疾病患病率和模型质量发生变化时引入偏差,尤其是影响下游诊断模型评估。本研究量化了大型语言模型标记错误如何影响随后的诊断模型评估。我们开发了一个模拟框架来评估大型语言模型标记错误如何影响观察到的模型性能。生成了包含 10,000 个案例的合成数据集,覆盖不同的患病率水平。独立变更大型语言模型的灵敏度和特异度,范围在 90% 到 100%。我们模拟了灵敏度和特异度分别从 90% 到 100% 的诊断模型。使用大型语言模型生成的标签作为参考标准计算观察到的性能。我们导出分析性能边界,并对每种条件运行 5,000 次蒙特卡洛试验以估计经验不确定性。观察到的性能对大型语言模型标签质量高度敏感,偏差受疾病患病率强烈影响。在低患病率情境下,大型语言模型特异度的微小减小时,会导致灵敏度的显著低估。例如,在 10% 患病率下,灵敏度为 95% 的大型语言模型会导致观察到的灵敏度约为 53%,尽管模型完美。在高患病率情境下,降低的大型语言模型灵敏度会导致模型特异度的低估。蒙特卡洛模拟始终揭示了向下偏差,观察到的性能往往在理论边界内时仍低于真实值。大型语言模型生成的标签会引入系统性的、取决于患病率的偏差,以影响模型评估。在低患病率任务中,特异度更为关键,而在高患病率情境下,灵敏度占主导地位。这些发现凸显了在临床人工智能中使用大型语言模型进行部署后模型评估时,患病率感知的提示设计和误差特征描述的重要性。

关键词

引用

@article{arxiv.2506.07273,
  title  = {Impact of Label Noise from Large Language Models Generated Annotations on Evaluation of Diagnostic Model Performance},
  author = {Mohammadreza Chavoshi and Hari Trivedi and Janice Newsome and Aawez Mansuri and Chiratidzo Rudado Sanyika and Rohan Satya Isaac and Frank Li and Theo Dapamede and Judy Gichoya},
  journal= {arXiv preprint arXiv:2506.07273},
  year   = {2026}
}