中文

DermaBench:一个面向皮肤病学视觉问答与推理的临床医生标注基准数据集

计算机视觉与模式识别 2026-01-21 v1 人工智能 计算与语言

摘要

视觉-语言模型(VLMs)在医学应用中日益重要;然而,它们在皮肤病学中的评估仍然受到数据集的限制,这些数据集主要关注图像级别的分类任务,如病变识别。虽然这些数据集对于识别很有价值,但无法评估多模态模型的完整视觉理解、语言基础以及临床推理能力。需要视觉问答(VQA)基准来评估模型如何解释皮肤病学图像、对细粒度形态进行推理以及生成具有临床意义的描述。我们介绍了DermaBench,一个基于多样化皮肤病图像(DDI)数据集构建的、由临床医生标注的皮肤病学VQA基准。DermaBench包含来自570位独特患者的656张临床图像,涵盖了菲茨帕特里克皮肤类型I-VI。使用包含22个主要问题(单选题、多选题和开放式问题)的分层标注模式,皮肤病学专家为每张图像标注了诊断、解剖部位、病变形态、分布、表面特征、颜色和图像质量,以及开放式叙述性描述和摘要,产生了大约14,474个VQA风格的标注。DermaBench作为仅元数据的数据集发布,以尊重上游许可协议,并可在Harvard Dataverse上公开获取。

关键词

引用

@article{arxiv.2601.14084,
  title  = {DermaBench: A Clinician-Annotated Benchmark Dataset for Dermatology Visual Question Answering and Reasoning},
  author = {Abdurrahim Yilmaz and Ozan Erdem and Ece Gokyayla and Ayda Acar and Burc Bugra Dagtas and Dilara Ilhan Erdil and Gulsum Gencoglan and Burak Temelkuran},
  journal= {arXiv preprint arXiv:2601.14084},
  year   = {2026}
}