中文

性别推断:ChatGPT能否超越常见商业工具?

计算与语言 2023-12-05 v1 人工智能

摘要

越来越多的研究利用性别信息来理解性别偏见、获取和参与的不平等,或新冠疫情应对的影响等现象。不幸的是,大多数数据集不包含自我报告的性别信息,这使得研究人员有必要从其他信息(如姓名或姓名与国家信息)中推断性别。这些工具的一个重要局限性是它们未能恰当捕捉性别存在于非二元尺度上的事实,然而,评估和比较这些工具在不同情境下的表现仍然很重要。在本文中,我们比较了生成式人工智能工具ChatGPT与三种基于列表和机器学习的商业性别推断工具(Namsor、Gender-API和genderize.io)在一个独特数据集上的性能。具体来说,我们使用了一个大型奥林匹克运动员数据集,并报告了输入的变化(例如,名字、名字和姓氏、有无国家信息)如何影响其预测的准确性。我们报告了完整数据集以及子集的结果:奖牌获得者与非奖牌获得者、来自最大英语国家的运动员以及来自东亚的运动员。在这些数据集上,我们发现Namsor是最好的传统商业工具。然而,ChatGPT的表现至少与Namsor相当,并且常常优于它,尤其是在有国家和/或姓氏信息时对女性样本的预测。所有工具在奖牌获得者上的表现优于非奖牌获得者,在英语国家姓名上的表现更好。尽管并非为此目的设计,ChatGPT可能是一种经济高效的性别预测工具。未来,ChatGPT或其他大规模语言模型甚至可能更好地识别自我报告的性别,而不是在二元尺度上报告性别。

关键词

引用

@article{arxiv.2312.00805,
  title  = {Gender inference: can chatGPT outperform common commercial tools?},
  author = {Michelle Alexopoulos and Kelly Lyons and Kaushar Mahetaji and Marcus Emmanuel Barnes and Rogan Gutwillinger},
  journal= {arXiv preprint arXiv:2312.00805},
  year   = {2023}
}

备注

14 pages, 8 tables