中文

AI如何失败:一个用于展示自动毒性模型中方言偏见的交互式教学工具

计算与语言 2026-04-02 v2 计算机与社会 人机交互

摘要

如今,AI驱动的审核已渗透到日常生活中,我们经常听到“AI有偏见”的说法。虽然这通常是开玩笑,但这种轻松的评论反映了更深层次的担忧。我们如何能确定一个被标记为“不当”的在线帖子不是仅仅成为了有偏算法下的牺牲品?本文采用双重方法研究这个问题。首先,我对一个广泛使用的毒性模型(unitary/toxic-bert)进行了定量基准测试,以衡量其在非裔美国英语(AAE)和标准美国英语(SAE)文本之间的性能差异。基准测试揭示了一种清晰、系统性的偏见:平均而言,该模型对AAE文本的毒性评分高出1.8倍,对“身份仇恨”的评分高出8.8倍。其次,我介绍了一个交互式教学工具,使这些抽象的偏见变得具体可感。该工具的核心机制是一个用户可控的“敏感度阈值”,它表明有偏的分数本身并非唯一的伤害;相反,更令人担忧的伤害是由人类设定的、看似中立的策略,这些策略最终将歧视操作化。这项工作既提供了差异性影响的统计证据,也提供了一个旨在培养批判性AI素养的面向公众的工具。

关键词

引用

@article{arxiv.2511.06676,
  title  = {How AI Fails: An Interactive Pedagogical Tool for Demonstrating Dialectal Bias in Automated Toxicity Models},
  author = {Subhojit Ghimire},
  journal= {arXiv preprint arXiv:2511.06676},
  year   = {2026}
}

备注

9 pages, 5 figures, 4 tables, 14 references