中文

面向可信赖皮肤科诊断的多模态大语言模型:诊断叙述的基准测试与评估器

计算机视觉与模式识别 2026-01-13 v2

摘要

多模态大语言模型(LLM)日益用于直接从图像生成皮肤科诊断叙述,但可靠的评估仍是负责任临床部署的主要瓶颈。我们引入了一个新的评估框架,将精心策划的基准测试 DermBench 与强大的自动评估器 DermEval 结合,以实现临床上有意义、可重复且可扩展的评估。我们构建 DermBench,将 4,000 张真实世界皮肤科图像与专家认证的诊断叙述配对,并使用基于 LLM 的评判器对候选叙述在临床导向维度上进行评分,从而实现对多模态模型进行一致且全面的评估。对于单个病例评估,我们训练 DermEval,这是一个无参考的多模态评估器。给定图像和生成的叙述,DermEval 会生成结构化的批评,包括整体评分和各维度评分。这一能力支持细粒度的单病例分析,这对于识别模型局限性和偏差至关重要。在包含 4,500 个病例的多样化数据集上进行的实验表明,DermBench 和 DermEval 均与专家评分高度一致,分别平均偏差为 0.251 和 0.117(满分 5 分),从而为不同多模态 LLM 的诊断能力和可信赖性提供可靠测量。

关键词

引用

@article{arxiv.2511.09195,
  title  = {Towards Trustworthy Dermatology MLLMs: A Benchmark and Multimodal Evaluator for Diagnostic Narratives},
  author = {Yuhao Shen and Jiahe Qian and Shuping Zhang and Zhangtianyi Chen and Tao Lu and Juexiao Zhou},
  journal= {arXiv preprint arXiv:2511.09195},
  year   = {2026}
}