中文

FairLLaVA:面向大型视觉语言助手的公平性感知参数高效微调

计算机视觉与模式识别 2026-03-30 v1 人工智能

摘要

虽然强大的图像条件生成能力突出了多模态大语言模型 (MLLM) 的优势,但这些模型在不同人口统计群体之间可能表现不均,凸显了公平性风险。在临床安全关键场景中,这类差异可能导致诊断叙述不平等,削弱对AI辅助决策的信任。虽然视觉模型和语言模型已广泛研究公平性问题,但其对MLLM的影响仍大体未被探索。为解决这些偏见,我们引入FairLLaVA,这是一种参数高效的微调方法,可在不牺牲整体性能的前提下缓解视觉指令调优中的群体差异。通过最小化目标属性之间的相互信息,FairLLaVA正规化了模型的表示,以实现人口统计无关性。该方法可作为轻量级插件 incorporated into low-rank adapter微调,保持高效,提供一种与体系结构无关的公平视觉指令遵循方法。针对大规模胸部放射学报告生成和皮肤科视觉问答基准进行了广泛实验,结果显示FairLLaVA在各医学影像模态下均能显著减少跨群体差异,同时提升基于公平性的临床表现和自然语言生成质量。代码可在 https://github.com/bhosalems/FairLLaVA 查阅。

关键词

引用

@article{arxiv.2603.26008,
  title  = {FairLLaVA: Fairness-Aware Parameter-Efficient Fine-Tuning for Large Vision-Language Assistants},
  author = {Mahesh Bhosale and Abdul Wasi and Shantam Srivastava and Shifa Latif and Tianyu Luan and Mingchen Gao and David Doermann and Xuan Gong},
  journal= {arXiv preprint arXiv:2603.26008},
  year   = {2026}
}

备注

Accepted to CVPR 2026