中文

审计多模态 LLM 评估器:临床有序评分中的中心倾向偏差

计算机视觉与模式识别 2026-05-19 v1

摘要

多模态大语言模型(LLM)越来越多地被用作临床环境中的自动评估器,但其在有序临床量表上的评分行为仍鲜有了解。我们对三类前沿 LLM 进行基准测试,针对两个公开数据集中的 Clock Drawing Test(CDT)图像使用 Shulman 评分标准。虽然完全微调的视觉 Transformer 实现了最佳校准(MAE 0.52,within-1 正确率 91%),但零样本 LLM 在容忍性一致性方面仍具竞争力(GPT-5 MAE 0.67,within-1 正确率 92%),尽管绝对误差更高。然而,按评分分析发现,三类 LLM 均表现出显著的中心倾向效应(系统性端点压缩):预测在量表中央偏压缩,低端(得分 0 到 1)高估,高端(得分 5 到 4)低估。该效应对临床关键的极端端点产生不成比例的影响,在这些端点上准确的评分最直接影响认知功能障碍筛查决策。针对性消除实验表明,无论是覆盖整个评分范围的少数样本示例,还是从提示中移除临床术语,都无法消除该效应。我们的发现将 LLM-as-a-judge 偏差文献从 NLP 评估扩展到临床评估,凸显了在高风险筛查工作流程中部署 LLM 评估器前需进行校准感知评估和事后校准的必要性。

关键词

引用

@article{arxiv.2605.16386,
  title  = {Auditing Multimodal LLM Raters: Central Tendency Bias in Clinical Ordinal Scoring},
  author = {Jiaqing Zhang and Sandeep Elluri and Bhanu Cherukuvada and Yonah Joffe and Jessica Sena and Miguel Contreras and Scott Siegel and Subhash Nerella and Catherine Price and Parisa Rashidi},
  journal= {arXiv preprint arXiv:2605.16386},
  year   = {2026}
}