GPT不是标注者:公平性基准构建中人类标注的必要性
计算与语言
2024-05-27 v1 计算机与社会
摘要
LLM中的社会偏见通常通过偏见基准数据集来衡量。当前的基准在范围、基础、质量和所需人力方面存在局限性。先前的工作已经展示了采用社区来源而非众包来源的基准开发方法的成功。然而,这项工作仍然需要具有相关生活经验的标注者付出相当大的努力。本文探讨了LLM(特别是GPT-3.5-Turbo)是否能够协助完成从开放式社区调查回复中开发偏见基准数据集的任务。我们还将先前的工作扩展到新的社区和偏见集:犹太社区和反犹太主义。我们的分析表明,GPT-3.5-Turbo在此标注任务上表现不佳,其输出存在不可接受的质量问题。因此,我们得出结论,GPT-3.5-Turbo不能作为人类标注的合适替代品,用于与社会偏见相关的敏感任务,并且它的使用实际上抵消了社区来源偏见基准的许多好处。
引用
@article{arxiv.2405.15760,
title = {GPT is Not an Annotator: The Necessity of Human Annotation in Fairness Benchmark Construction},
author = {Virginia K. Felkner and Jennifer A. Thompson and Jonathan May},
journal= {arXiv preprint arXiv:2405.15760},
year = {2024}
}
备注
Accepted to ACL 2024 (main conference)