修正文档:刻画机器学习中语音数据集文档实践
人机交互
2023-03-21 v1 计算机与社会
声音
音频与语音处理
摘要
语音赋能技术正迅速普及,其由语音识别与语音活动检测等机器学习(ML)赋能组件构成。然而,这些系统尚不能对所有人良好工作。它们表现出偏见——即相对于其他个体或群体,对特定个体或群体系统性、不公平的歧视(Friedman & Nissembaum, 1996)——横跨年龄、性别与口音等维度。ML 依赖大规模数据集进行训练。数据集文档旨在让 ML 从业者(MLP)更好地理解数据集特征。然而,针对语音数据集文档的实证研究仍然匮乏。此外,尽管 MLP 是公平性研究中的常见参与者,鲜有工作关注那些处理语音数据的人。我们的工作对这一空白做出了实证贡献。在此,我们结合两种方法形成一项探索性研究。首先,我们开展了 13 场半结构化访谈,探讨语音数据集文档实践的多重视角。借助开放与轴向编码方法,我们通过角色与权衡的视角考察 MLP 的实践。基于此,我们有目的地抽取了 9 个语音数据集的语音数据集文档(VDD)。随后,我们的发现通过 MLP 角色与权衡视角对这两种方法进行三角验证。我们发现,当前的 VDD 实践尚不成熟、不充分且不可通约。语音数据集的特征以碎片化、 disjoint 的方式被编码,往往无法满足 MLP 的需求。此外,它们难以直接比较,给从业者的偏见消减努力造成了障碍。接着,我们讨论了这些发现对语音数据与语音技术中偏见实践的影响。最后,我们提出未来工作计划以应对这些发现——即我们如何能够“修正文档”。
引用
@article{arxiv.2303.10721,
title = {Right the docs: Characterising voice dataset documentation practices used in machine learning},
author = {Kathy Reid and Elizabeth T. Williams},
journal= {arXiv preprint arXiv:2303.10721},
year = {2023}
}
备注
16 pages, 3 tables, preprint of a submission to AIES 2023