Say My Name:深度模型偏见发现框架
机器学习
2025-10-17 v2 人工智能
计算机与社会
摘要
近年来,随着深度学习在下游任务和端到端训练中的广泛应用,日益增多的关于特定非代表性模式潜在偏见的担忧被提出。许多聚焦于无监督去偏的方法通常利用深度模型学习“更易”样本的倾向,例如通过聚类潜在空间获取偏见伪标签。然而,尤其对于非专家端用户而言,这些伪标签的解释并不直观,因为它们未提供关于偏见特征的语义信息。为此,我们引入“Say My Name”(SaMyNa),这是第一个在深度模型中语义化识别偏见的工具。不同于现有方法,我们的方法聚焦于模型学习的偏见。我们的文本基方法提升可解释性并支持去偏工作:适用于训练期间或事后验证,我们的方法可解耦任务相关信息,作为诊断工具使用。在传统基准测试上的评估表明其在检测偏见方面有效,即使可以“否定”这些偏见,展示了其广泛的模型诊断适用性。
引用
@article{arxiv.2408.09570,
title = {Say My Name: a Model's Bias Discovery Framework},
author = {Massimiliano Ciranni and Luca Molinaro and Carlo Alberto Barbano and Attilio Fiandrotti and Vittorio Murino and Vito Paolo Pastore and Enzo Tartaglione},
journal= {arXiv preprint arXiv:2408.09570},
year = {2025}
}