GPT 检测器对非英语母语写作者存在偏见
计算与语言
2023-07-13 v3 人工智能
人机交互
机器学习
摘要
生成式语言模型的快速采用为数字通信带来了实质性进步,同时也引发了关于 AI 生成内容潜在滥用的担忧。尽管已提出众多检测方法来区分 AI 与人类生成的内容,这些检测器的公平性与鲁棒性仍鲜有探究。在本研究中,我们使用母语与非母语英语写作者的写作样本评估了几种广泛使用的 GPT 检测器的性能。我们的发现表明,这些检测器持续将非母语英语写作样本误分类为 AI 生成,而母语写作样本则被准确识别。此外,我们证明简单的提示策略不仅能缓解此偏见,还能有效绕过 GPT 检测器,这表明 GPT 检测器可能无意中惩罚了语言表达受限的写作者。我们的结果呼吁就部署 ChatGPT 内容检测器的伦理影响展开更广泛的讨论,并警示在其用于评估或教育场景时的风险,尤其是当它们可能无意中惩罚或排除非母语英语使用者参与全球话语时。本研究的发表版本可访问:www.cell.com/patterns/fulltext/S2666-3899(23)00130-7
引用
@article{arxiv.2304.02819,
title = {GPT detectors are biased against non-native English writers},
author = {Weixin Liang and Mert Yuksekgonul and Yining Mao and Eric Wu and James Zou},
journal= {arXiv preprint arXiv:2304.02819},
year = {2023}
}