惊奇的偏见是什么(它们在哪里)?
计算与语言
2024-11-25 v1 计算机视觉与模式识别
计算机与社会
机器学习
摘要
深度学习模型倾向于从大型数据集中学习模式相关性。这些系统越大,能够检测的现象就越复杂,需要的数据也越多。人工智能(AI)的使用正在变得越来越普遍,其影响正在日益增长。它所承诺的前景强烈地依赖于其公平且普遍的使用,例如为所有人提供信息或教育的便利。在不平等的世界中,它们可以帮助到达最不便利的地区。然而,这种普遍的系统必须能够代表社会,而不以牺牲他人为代价来获益。我们不能复制我们所观察到的不平等,而是教育这些AI去超越它们。我们已经看到了这些系统在解决其任务方面不恰当地使用性别、种族甚至阶级信息的情况。相对于真正的因果推理,它们依赖于虚假关联,这就是我们通常称之为偏见的东西。在本文中,我们首先尝试以一般性术语定义什么是偏见。这有助于我们澄清偏见的概念,理解我们为何处处都能找到它们,以及它们为何有时有用。其次,我们聚焦于一般被视为消极偏见的概念,即我们要在机器学习中避免的偏见,然后呈现一个包含最常见偏见的总体动物学。最后,我们通过使用特别精心设计的数据集模板和特定算法来检测它们的经典方法,以及通过这些方法来缓解它们的经典方法来结束本文。
引用
@article{arxiv.2411.15051,
title = {Fantastic Biases (What are They) and Where to Find Them},
author = {Valentin Barriere},
journal= {arXiv preprint arXiv:2411.15051},
year = {2024}
}
备注
Publication in Spanish in the Journal Bits de Ciencias: https://www.dcc.uchile.cl/media/bits/pdfs/bits26.2-sesgos-fantasticos.pdf