评估与缓解基于 AI 的医学文本生成中的偏见
计算与语言
2025-04-25 v1
摘要
人工智能(AI)系统,尤其是基于深度学习模型的系统,在医学应用中已逐渐达到专家水平的性能。然而,越来越多的人担心,这些 AI 系统可能反映并放大人类的偏见,在历史上服务不足的群体中降低其性能质量。在医学影像分类领域,公平性问题引起了 considerable 研究兴趣,但在文本生成领域仍受到 insufficient 关注。本研究聚焦于医学领域文本生成中的公平性问题,观察到在不同种族、性别和年龄组,包括交叉组合组,各种模型规模和不同评估指标下都存在显著的性能差异。为缓解这种公平性问题,我们提出了一种算法,通过选择性优化表现不佳的群体来减少偏见。该选择规则不仅考虑词级准确率,还考虑对目标参考的病理学准确率,而且确保整个过程在有效模型训练中保持全可微。我们在多个主干模型、数据集和模态上进行评估,证明我们的算法在不牺牲整体性能的前提下提升了文本生成的公平性。具体而言,我们的算法在不同指标下消除了各种群体之间的差异,幅度超过 30%,而文本生成准确率的相对变化通常在 2% 范围内。通过减少深度学习模型产生的偏见,我们的所提出的方法可能有助于缓解关于医学领域文本生成诊断公平性和可靠性的担忧。我们的代码已公开可用,以便进一步研究,访问地址为 https://github.com/iriscxy/GenFair。
引用
@article{arxiv.2504.17279,
title = {Evaluating and Mitigating Bias in AI-Based Medical Text Generation},
author = {Xiuying Chen and Tairan Wang and Juexiao Zhou and Zirui Song and Xin Gao and Xiangliang Zhang},
journal= {arXiv preprint arXiv:2504.17279},
year = {2025}
}
备注
12 pages, 8 figures, published in Nature Computational Science