FAIR_XAI:通过可解释性提升多模态基础模型公平性用于健康评估
人工智能
2026-04-28 v1 机器学习
摘要
近年来,将多模态机器学习集成到健康评估中为监测精神健康提供了变革性潜力。然而,随着视觉语言模型(VLM)的快速发展,其在临床环境中的部署引发了透明度不足和潜在偏见的担忧。尽管已有研究探索了公平性与可解释 AI(XAI)的交叉应用,但其针对 VLM 用于健康评估和抑郁预测的应用仍不充分。本文调查 VLM 在实验室(AFAR-BSFT)和自然环境(E-DAIC)数据集上的性能,聚焦诊断可靠性和人口统计学公平性。性能在不同环境和架构之间差异显著;Phi3.5-Vision 在 E-DAIC 上达到 80.4\% 的准确率,而 Qwen2-VL 仅为 33.9\%。此外,两者都表现出在 AFAR-BSFT 上过度预测抑郁的倾向。尽管两者都存在偏见,Qwen2-VL 显示更高的性别差异,而 Phi-3.5-Vision 则表现出更大的种族偏见。我们的 XAI 干预框架结果不一;公平性提示在 E-DAIC 上为 Qwen2-VL 实现了完美的平等机会,但以严重的准确率代价。在 AFAR-BSFT 上,可解释性干预改善了程序一致性,但未保证结果公平,甚至有时会放大种族偏见。这些结果凸显了程序透明度与公平结果之间持续的鸿沟。我们分析了这些发现并总结出具体建议,强调未来的公平性干预必须同时优化预测准确率、人口统计学平等和跨域泛化。
引用
@article{arxiv.2604.23786,
title = {FAIR_XAI: Improving Multimodal Foundation Model Fairness via Explainability for Wellbeing Assessment},
author = {Sophie Chiang and Tom Brennan and Fethiye Irmak Dogan and Jiaee Cheong and Hatice Gunes},
journal= {arXiv preprint arXiv:2604.23786},
year = {2026}
}
备注
10 pages, 4 figures, 3 tables