中文

无障碍主义 AI 数据集注释:与会者共同设计 stuttering 语音注释指南

人机交互 2026-02-12 v1

摘要

尽管努力增加残障人士在 AI 数据集中的代表性,但无障碍数据集往往由 lack of disability-specific 专业知识的众包工作者进行注释,导致标签不一致或不准确。本文通过对 stuttered speech 数据注释案例研究,探讨了这些注释挑战。鉴于 stuttering 的多样性以及对其表现方式的不同看法,即使是经过训练的专业人员,也难以进行 stuttered speech 的注释和转录。通过与 stuttered speech 数据的受访者和领域专家进行访谈和共同设计工作坊,我们确定了 stuttered speech 注释的挑战,并开发了将 stuttered speech 数据持有者的 lived experience 融入注释过程的实践。我们的发现凸显了具身知识在改善数据集质量方面的价值,同时揭示了残障经验的复杂性与静态标签刚性之间的张力。我们以多样性感知的方法在 AI 管道中进行数据解释,提出了无障碍主义的含义。

关键词

引用

@article{arxiv.2602.10403,
  title  = {Disability-First AI Dataset Annotation: Co-designing Stuttered Speech Annotation Guidelines with People Who Stutter},
  author = {Xinru Tang and Jingjin Li and Shaomei Wu},
  journal= {arXiv preprint arXiv:2602.10403},
  year   = {2026}
}