中文

医学视觉语言模型可信度综合基准——CARES

机器学习 2024-11-05 v3 计算与语言 计算机视觉与模式识别 计算机与社会

摘要

人工智能已在医学应用中产生重大影响,尤其是随着医学大型视觉语言模型(Med-LVLMs)的出现,为未来的自动化和个性化医疗保健带来希望。然而,Med-LVLMs的可信度尚未得到验证,为未来模型部署带来重大风险。本文介绍了CARES(Comprehensive Benchmark of Trustworthiness in Medical Vision Language Models),旨在全面评估Med-LVLMs的可信度。我们在医学领域评估Med-LVLMs的可信度,包括可信度、公平性、安全性、隐私和鲁棒性五个维度。CARES包含约41K个问答对,覆盖16种医学图像模态和27个解剖区域。我们的分析显示,模型在可信度方面普遍存在疑虑,常表现出事实性错误,无法在不同人口统计群体间保持公平。此外,模型易受攻击,且缺乏隐私意识。我们公开发布了该基准及代码:https://cares-ai.github.io/。

关键词

引用

@article{arxiv.2406.06007,
  title  = {CARES: A Comprehensive Benchmark of Trustworthiness in Medical Vision Language Models},
  author = {Peng Xia and Ze Chen and Juanxi Tian and Yangrui Gong and Ruibo Hou and Yue Xu and Zhenbang Wu and Zhiyuan Fan and Yiyang Zhou and Kangyu Zhu and Wenhao Zheng and Zhaoyang Wang and Xiao Wang and Xuchao Zhang and Chetan Bansal and Marc Niethammer and Junzhou Huang and Hongtu Zhu and Yun Li and Jimeng Sun and Zongyuan Ge and Gang Li and James Zou and Huaxiu Yao},
  journal= {arXiv preprint arXiv:2406.06007},
  year   = {2024}
}

备注

NeurIPS 2024 Datasets and Benchmarks Track