审计自动语音识别技术中的常见陷阱:以册氏症患者为例
计算机与社会
2026-05-28 v3 计算与语言
声音
音频与语音处理
摘要
自动语音识别 (ASR) 系统的日益普及要求建立稳健的审计方法,以确保平等的转录质量,尤其是对于因语言障碍如册氏症而 disproportionately 依赖 ASR 的人群。尽管学术和行业审计已揭示了不同用户群体之间的性能差异,但标准审计实践常常忽略这些细微之处,风险掩盖了对边缘群体的伤害。我们识别了标准 ASR 审计中三个常见陷阱:(1) 遵循单一的文本标准化方法,这可能掩盖 ASR 性能的差异,忽视边缘社区的标准化偏好;(2) 在不考虑细化的交叉子群体或条件相关声学属性的前提下,仅显示高层次的人口学发现;(3) 仅报告一种黄金标准指标 (Word Error Rate),该指标不充分量化诸如幻觉等常见生成式 AI 错误。我们提出了一套综合性的审计框架,以应对这些陷阱,并在六个流行 ASR 系统的案例研究中发现,册氏症说话者的 ASR 性能持续低于对照组。我们呼吁实践者实施这些稳健、以社区为导向的 ASR 审计实践,以更好地适应快速变化的 ASR 环境。
引用
@article{arxiv.2506.08846,
title = {Addressing Pitfalls in Auditing Practices of Automatic Speech Recognition Technologies: A Case Study of People with Aphasia},
author = {Katelyn Xiaoying Mei and Anna Seo Gyeong Choi and Hilke Schellmann and Mona Sloane and Allison Koenecke},
journal= {arXiv preprint arXiv:2506.08846},
year = {2026}
}
备注
Published at the Proceedings of The 2026 ACM Conference on Fairness, Accountability, and Transparency (FAccT '26)