面向公平性评估的语音识别数据集:Fair-Speech
人工智能
2024-08-26 v1 计算机与社会
声音
音频与语音处理
机器学习
摘要
当前公开的语音识别 (ASR) 数据集往往未专注于公平性问题,例如在不同人口统计群体上的表现。本文引入新型数据集 Fair-Speech,是一个公开的语料库,帮助研究者评估其 ASR 模型在包括年龄、性别、种族、地理差异以及参与者是否自认是母语者等多元化自报告人口统计信息下的准确率。我们的数据集包含约 26.5 万段 593 名美国居民录制的语音指令。我们还提供了 ASR 基线模型,包括在转录和未转录的社交媒体视频上训练的模型以及开源模型。
引用
@article{arxiv.2408.12734,
title = {Towards measuring fairness in speech recognition: Fair-Speech dataset},
author = {Irina-Elena Veliche and Zhuangqun Huang and Vineeth Ayyat Kochaniyan and Fuchun Peng and Ozlem Kalinli and Michael L. Seltzer},
journal= {arXiv preprint arXiv:2408.12734},
year = {2024}
}