探索基础模型中的偏见:影响、测试、伤害与缓解
机器学习
2025-01-22 v1 人工智能
计算机与社会
摘要
基础模型(Foundation Models, FMs)中的偏见——这些模型是在跨越社会与历史知识的大规模数据集上训练的——在医疗、教育和金融等领域引发公平性与平等性方面的重大挑战。这些偏见源于训练数据中刻板印象和社会不平等的过度代表化,加剧了现实世界的歧视,强化了有害刻板印象,并削弱了对AI系统信任。为应对这一问题,本文引入了三叉戟探针测试(Trident Probe Testing, TriProTesting),这是一种系统性的测试方法,用于检测显式和隐式偏见。我们展示了包括CLIP、ALIGN、BridgeTower和OWLv2在内的基础模型在单一社会属性(性别、种族、年龄和职业)以及混合社会属性(性别×种族、性别×年龄、性别×职业)方面表现出普遍偏见。我们进一步提出了自适应逻辑调整(Adaptive Logit Adjustment, AdaLogAdjustment),这是一种后处理技术,通过动态重新分配概率能量来有效缓解这些偏见,在不重新训练模型的情况下显著提升公平性。这些发现凸显了迫切需要伦理AI实践和跨学科解决方案的紧迫性,以解决不仅在模型层面,还在社会结构中的偏见。我们的工作提供了一种可扩展且可解释的解决方案,推动AI系统公平性,同时为未来公平AI技术研究提供了实用见解。
引用
@article{arxiv.2501.10453,
title = {Uncovering Bias in Foundation Models: Impact, Testing, Harm, and Mitigation},
author = {Shuzhou Sun and Li Liu and Yongxiang Liu and Zhen Liu and Shuanghui Zhang and Janne Heikkilä and Xiang Li},
journal= {arXiv preprint arXiv:2501.10453},
year = {2025}
}
备注
60 pages, 5 figures