中文

迈向 AI 公平性度量:Casual Conversations 数据集

计算机视觉与模式识别 2021-11-05 v2 人工智能 机器学习

摘要

本文引入一个新的数据集,以帮助研究者在年龄、性别、表观肤色和环境光照条件多样的集合上评估其计算机视觉与音频模型的准确性。我们的数据集由 3,011 名受试者组成,包含超过 45,000 段视频,平均每人 15 段。这些视频在美国多个州录制,受试者为一群多样的成年人,涵盖不同的年龄、性别与表观肤色组别。一个关键特征是每位受试者均同意参与并允许使用其肖像。此外,我们的年龄与性别标注由受试者本人提供。一组受过训练的标注者使用 Fitzpatrick 皮肤类型量表标注了受试者的表观肤色。并且,也提供了低环境光照下所录视频的标注。作为跨特定属性度量预测鲁棒性的应用,我们对 DeepFake Detection Challenge(DFDC)的前五名优胜者进行了综合研究。实验评估显示,优胜模型在某些特定人群(如肤色较深的受试者)上表现较差,因而可能无法泛化至所有人。此外,我们也评估了最先进的表观年龄与性别分类方法。我们的实验对这些模型在公平对待不同背景人群方面提供了透彻分析。

关键词

引用

@article{arxiv.2104.02821,
  title  = {Towards Measuring Fairness in AI: the Casual Conversations Dataset},
  author = {Caner Hazirbas and Joanna Bitton and Brian Dolhansky and Jacqueline Pan and Albert Gordo and Cristian Canton Ferrer},
  journal= {arXiv preprint arXiv:2104.02821},
  year   = {2021}
}