中文

FMBench:面向医学任务的多模态大语言模型公平性基准测试

计算机视觉与模式识别 2024-10-03 v1

摘要

多模态大语言模型(MLLMs)的进展显著提升了医学任务性能,如视觉问答(VQA)和报告生成(RG)。然而,这些模型在跨越多样人口统计学群体的公平性仍未得到充分探讨,尽管在医疗保健领域这一问题至关重要。这种忽视部分源于现有医学多模态数据集缺乏人口统计学多样性, complicating公平性评估。在此基础上,我们提出FMBench,即首个旨在评估MLLMs在多样人口统计学属性下性能公平性的基准测试。FMBench具有以下关键特性:1. 包含四种人口统计学属性:种族、民族、语言和性别,涵盖VQA和RG两个任务,基于零样本设置。2. 我们的VQA任务为自由形式,增强了现实应用场景的可行性,减轻了基于预定义选项的偏见。3. 我们采用词汇指标和基于LLM的指标,符合临床评估标准,不仅从语言准确性,还从临床角度评估模型。此外,我们引入新指标——公平性感知性能(Fairness-Aware Performance, FAP),用于评估MLLMs在各种人口统计学属性下的公平性。我们在 proposed基准测试上,对八个最先进的开源MLLMs进行了彻底的性能和公平性评估,包括通用型和医学型MLLMs,参数规模从7B到26B。我们希望FMBench能帮助研究社区改进模型评估,推动该领域的未来发展。所有数据和代码将在接受后公开。

关键词

引用

@article{arxiv.2410.01089,
  title  = {FMBench: Benchmarking Fairness in Multimodal Large Language Models on Medical Tasks},
  author = {Peiran Wu and Che Liu and Canyu Chen and Jun Li and Cosmin I. Bercea and Rossella Arcucci},
  journal= {arXiv preprint arXiv:2410.01089},
  year   = {2024}
}