中文

适应大语言模型以缓解临床皮肤病学任务中的皮肤色调偏见:混合方法研究

图像与视频处理 2025-10-08 v2 计算机视觉与模式识别 计算机与社会

摘要

SkinGPT-4是一种大型视觉语言模型,利用标注的皮肤病图像来增强来自资源不足地区的临床工作流程。然而,其训练数据主要代表较浅的皮肤色调,限制了对较深皮肤色调的诊断准确性。本文评估了SkinGPT-4在常见皮肤疾病(包括特应性皮炎、过敏性接触性皮炎和银屑病)上的性能偏见,数据来源于公开的SCIN数据集。我们在SkinGPT-4基础上开发了针对特定皮肤疾病分类任务的微调模型,并探讨了偏见缓解策略。由皮肤科专家认证医生对300例SCIN病例中的六种相关皮肤疾病进行临床评估,评估图像在诊断准确性、信息性、医生实用性和患者实用性方面的表现。计算了跨皮肤色调的模型公平性指标,包括人口统计学公平性和平等机会率。在评估指标中,最浅皮肤色调与最深皮肤色调之间存在0.10-0.15的差异。SkinGPT-4在Fitzpatrick类型上的平均人口统计学公平性为0.10。我们的定制模型在视觉上相似的疾病对中实现了0.75的平均F1分数、0.78的精确率和0.78的AUROC。公平性分析显示平均人口统计学公平性为0.75,跨皮肤色调的最大差异为0.21。最佳模型在Fitzpatrick I-VI上的公平性得分为0.83、0.83、0.76、0.89、0.90和0.90,表明具有稳健的公平性。大型语言模型如SkinGPT-4在较深皮肤色调上的表现较差。存在模型偏见,且幻觉可能影响诊断效果。这些发现表明,使用现有 backbone 训练准确、公平的模型用于定制皮肤疾病分类是有效的。

关键词

引用

@article{arxiv.2510.00055,
  title  = {Adapting Large Language Models to Mitigate Skin Tone Biases in Clinical Dermatology Tasks: A Mixed-Methods Study},
  author = {Kiran Nijjer and Ryan Bui and Derek Jiu and Adnan Ahmed and Peter Wang and Kevin Zhu and Lilly Zhu},
  journal= {arXiv preprint arXiv:2510.00055},
  year   = {2025}
}

备注

Accepted to EADV (European Academy of Dermatology) and SID (Society for Investigative Dermatology)