DCAST:多样化的类别感知自训练缓解选择偏差以实现更公平的学习
机器学习
2024-10-10 v2 计算机与社会
摘要
机器学习中的公平性旨在减轻模型基于性别或年龄等敏感特征对个体产生的偏差,这种偏差通常由训练数据中由于选择偏差导致的人群代表性不均所引起。值得注意的是,非敏感特征引起的偏差难以识别且通常未被诊断,尽管它在计算机视觉和分子生物医学等领域的高维复杂数据中普遍存在。缓解未识别偏差的策略以及评估缓解方法至关重要,但尚未得到充分探索。我们引入了:(i) 多样化的类别感知自训练(DCAST),这是一种模型无关的、感知类别特定偏差的缓解方法,它通过促进样本多样性来对抗传统自训练中的确认偏差,同时利用未标记样本以改善对底层人群的表示;(ii) 层级偏差,一种无需先验知识的多变量、类别感知的偏差引入方法。使用 DCAST 学习的模型在十一个数据集上,相较于传统自训练和六种著名的领域自适应技术,对层级偏差和其他偏差表现出更强的鲁棒性。在多类分类任务上优势最为显著,这凸显了 DCAST 作为在不同背景下实现更公平学习的一种有前景的策略。
引用
@article{arxiv.2409.20126,
title = {DCAST: Diverse Class-Aware Self-Training Mitigates Selection Bias for Fairer Learning},
author = {Yasin I. Tepeli and Joana P. Gonçalves},
journal= {arXiv preprint arXiv:2409.20126},
year = {2024}
}
备注
16 pages of main paper, 6 main figures