面向公平人工智能的数据质量维度
人工智能
2025-04-03 v2 计算机科学中的逻辑
摘要
人工智能(AI)系统并非内在中立,偏见会渗入各类技术工具。尤其在涉及人的场景中,由错误标注数据引发的 AI 算法技术偏差所造成的影响不可否认。由于这些系统输出错误且歧视性的分类,它们并未被系统性地防范偏见。本文从数据质量维度的视角考察 AI 系统中的偏见问题。我们指出基于准确率策略的偏见缓解工具在模型构建上的局限性,并以一个具体工具在两类典型困难情境中的性别分类错误为例说明可能的改进:非二元个体的分类,其标签集相对于数据集不完整;以及跨性别个体的分类,其数据集相对于标签集不一致。利用形式化方法推理分类系统在变化世界下的行为,我们提议从完整性、一致性、及时性与可靠性重新审视分类任务的公平性,并给出若干理论结果。
引用
@article{arxiv.2305.06967,
title = {Data quality dimensions for fair AI},
author = {Camilla Quaresmini and Giuseppe Primiero},
journal= {arXiv preprint arXiv:2305.06967},
year = {2025}
}