用于医学图像分析的鲁棒公平视觉语言学习
计算机视觉与模式识别
2025-05-07 v1
摘要
视觉语言模型(VLM)在医学图像分析中的出现,有望帮助处理多模态输入并提高相对于传统推理方法的性能。然而,考虑到这些模型将要部署的领域,公平性和鲁棒性对于确保模型对任何患者都保持真实至关重要。在本文中,我们引入了一个确保VLM模型鲁棒性和公平性的框架。该框架通过在训练时修改损失函数来实现,具体通过动态坏对挖掘算法识别并调整错误的图像-文本对,并利用Sinkhorn距离确保受保护群体的损失分布不偏离总损失。对我们框架的实验测试表明,在考虑公平性缩放的AUC指标上,性能提升高达8.6%。
引用
@article{arxiv.2505.03153,
title = {Robust Fairness Vision-Language Learning for Medical Image Analysis},
author = {Sparsh Bansal and Mingyang Wu and Xin Wang and Shu Hu},
journal= {arXiv preprint arXiv:2505.03153},
year = {2025}
}