中文

超越像素一致性:作为可靠医学图像分割临床护栏的大型语言模型

图像与视频处理 2025-06-03 v1

摘要

评估AI生成的医学图像分割是否符合临床适用性是一项重大挑战,因为传统的像素一致性指标往往无法捕捉真正的诊断价值。本文提出了分层临床推理器(HCR),这是一种利用大型语言模型(LLMs)作为临床护栏以实现可靠、零样本质量评估的新框架。HCR采用结构化的多阶段提示策略,引导LLMs经历包含知识回忆、视觉特征分析、解剖推理和临床综合的详细推理过程,以评估分割结果。我们在跨越六项医学成像任务的多样化数据集上对HCR进行了评估。结果表明,利用Gemini 2.5 Flash等模型的HCR实现了78.12%的分类准确率,其表现与专门针对此任务训练的视觉模型(如准确率为72.92%的ResNet50)相当,在某些情况下甚至超越了它们。HCR框架不仅提供了准确的质量分类,还为其评估生成了可解释的、逐步的推理过程。这项工作展示了LLMs在适当引导下作为复杂评估器的潜力,为医学成像中的AI提供了迈向更值得信赖且符合临床导向的质量控制路径。

关键词

引用

@article{arxiv.2506.01841,
  title  = {Beyond Pixel Agreement: Large Language Models as Clinical Guardrails for Reliable Medical Image Segmentation},
  author = {Jiaxi Sheng and Leyi Yu and Haoyue Li and Yifan Gao and Xin Gao},
  journal= {arXiv preprint arXiv:2506.01841},
  year   = {2025}
}

备注

under review