批判性视角:一个揭示 PerspectiveAPI 缺陷的基准
计算与语言
2023-01-06 v1 计算机与社会
机器学习
摘要
检测互联网内容中的“有毒”语言是一项紧迫的社会与技术挑战。本工作中,我们关注来自 Jigsaw 的 PERSPECTIVE,这是一个承诺对文本“毒性”打分的最先进工具,其近期模型更新声称取得了令人印象深刻的结果(Lees 等,2022)。我们旨在通过提出一个新基准 Selected Adversarial SemanticS(即 SASS)来挑战关于有毒语言的某些规范性主张。我们在 SASS 上评估 PERSPECTIVE,并在二分类设定中与低代价替代方案(如零样本和少样本 GPT-3 提示模型)进行比较。我们发现 PERSPECTIVE 在多个我们的毒性类别上表现出令人担忧的缺陷。SASS 提供了一个评估先前未检测到的有毒语言性能的新工具,可避免常见的规范性陷阱。我们的工作使我们强调质疑已部署的毒性检测工具所作假设的重要性,以预期并防止差异性危害。
引用
@article{arxiv.2301.01874,
title = {Critical Perspectives: A Benchmark Revealing Pitfalls in PerspectiveAPI},
author = {Lorena Piedras and Lucas Rosenblatt and Julia Wilkins},
journal= {arXiv preprint arXiv:2301.01874},
year = {2023}
}