Casual Conversations v2 数据集
计算机视觉与模式识别
2023-03-10 v1 人工智能
计算与语言
计算机与社会
摘要
本文介绍一个新的大规模知情同意驱动数据集,旨在协助评估计算机视觉与音频语音模型在 11 个由自我提供或经训练标注者标注属性上的算法偏见与鲁棒性。该数据集包含来自 5,567 名唯一付费参与者的 26,467 段视频,平均每人近 5 段视频,录制于巴西、印度、印度尼西亚、墨西哥、越南、菲律宾与美国,代表了多样的人口统计学特征。参与者同意将其数据用于评估 AI 模型公平性,并提供了自我报告的年龄、性别、语言/方言、残障状况、身体饰物、身体属性与地理位置信息,而训练标注者使用 Fitzpatrick 肤色类型与 Monk 肤色量表标注表观肤色,以及嗓音音色。标注者还标注了不同录制设置与逐秒活动注释。
引用
@article{arxiv.2303.04838,
title = {The Casual Conversations v2 Dataset},
author = {Bilal Porgali and Vítor Albiero and Jordan Ryda and Cristian Canton Ferrer and Caner Hazirbas},
journal= {arXiv preprint arXiv:2303.04838},
year = {2023}
}