对文本数据性别分析器的审计
计算机与社会
2023-10-11 v1 计算与语言
摘要
AI模型已变得极为流行且为公众所易用。然而,由于其对社会中诸如有色人种和非二元性别者等群体的明显偏见,它们持续受到审视。在本研究中,我们审计了三种现有性别分析器——uClassify、Readable和HackerFactor,以检验其针对非二元性别个体的偏见。这些工具仅被设计用于预测顺性别二元标签,从而导致对社会中非二元性别成员的歧视。我们整理了两个不同的数据集——Reddit评论(66万条)和Tumblr帖子(205万条),实验评估显示这些工具在所有平台上的总体准确率约为50%,高度不准确。所有平台上对非二元评论的预测多为女性,从而传播了非二元个体阴柔化的社会偏见。为此,我们在两个数据集的多种组合上微调了一个BERT多标签分类器,观察到在最具现实部署性的设定下总体性能约77%,而非二元类别的性能惊人地高达90%。我们还使用零样本提示在小型数据集(因价格高昂)上对ChatGPT进行了审计,观察到Reddit和Tumblr合并平均准确率为58%(Reddit结果整体更好)。因此,我们表明现有系统,包括如ChatGPT等高度先进的系统,都存在偏见,需要更好的审计与 moderation;并且此类社会偏见可通过在更具性别包容性的数据集上训练如BERT等现成简单模型来加以解决和缓解。
引用
@article{arxiv.2310.06061,
title = {Auditing Gender Analyzers on Text Data},
author = {Siddharth D Jaiswal and Ankit Kumar Verma and Animesh Mukherjee},
journal= {arXiv preprint arXiv:2310.06061},
year = {2023}
}
备注
This work has been accepted at IEEE/ACM ASONAM 2023. Please cite the version appearing in the ASONAM proceedings