中文

Casual Conversations v2 数据集

计算机视觉与模式识别 2023-03-10 v1 人工智能 计算与语言 计算机与社会

摘要

本文介绍一个新的大规模知情同意驱动数据集,旨在协助评估计算机视觉与音频语音模型在 11 个由自我提供或经训练标注者标注属性上的算法偏见与鲁棒性。该数据集包含来自 5,567 名唯一付费参与者的 26,467 段视频,平均每人近 5 段视频,录制于巴西、印度、印度尼西亚、墨西哥、越南、菲律宾与美国,代表了多样的人口统计学特征。参与者同意将其数据用于评估 AI 模型公平性,并提供了自我报告的年龄、性别、语言/方言、残障状况、身体饰物、身体属性与地理位置信息,而训练标注者使用 Fitzpatrick 肤色类型与 Monk 肤色量表标注表观肤色,以及嗓音音色。标注者还标注了不同录制设置与逐秒活动注释。

关键词

引用

@article{arxiv.2303.04838,
  title  = {The Casual Conversations v2 Dataset},
  author = {Bilal Porgali and Vítor Albiero and Jordan Ryda and Cristian Canton Ferrer and Caner Hazirbas},
  journal= {arXiv preprint arXiv:2303.04838},
  year   = {2023}
}