大型语言模型存在地理偏见
计算与语言
2024-10-08 v2 人工智能
计算机与社会
机器学习
摘要
大型语言模型(LLMs)固有地携带其训练语料库中包含的偏见,这可能导致社会危害的持续。随着这些基础模型影响力的增长,理解和评估其偏见对于实现公平性和准确性至关重要。我们提议通过地理视角研究LLMs对我们所居住世界的了解。这种方法特别强大,因为人类生活的许多方面(如文化、种族、语言、政治和宗教)都有意义地投影到地理空间上,并存在真实数据。我们展示了各种有问题的地理偏见,我们将其定义为地理空间预测中的系统性错误。最初,我们证明LLMs能够以评分形式进行准确的零样本地理空间预测,这些评分与真实数据显示出强烈的单调相关性(Spearman's ρ高达0.89)。然后,我们展示LLMs在一系列客观和主观主题上表现出共同的偏见。特别是,LLMs明显对较低社会经济状况的地区(例如非洲大部分地区)在多种敏感主观主题(如吸引力、道德和智力)上存在偏见(Spearman's ρ高达0.70)。最后,我们引入一个偏见分数来量化这一点,并发现现有LLMs之间的偏见幅度存在显著差异。代码可在项目网站获取:https://rohinmanvi.github.io/GeoLLM
引用
@article{arxiv.2402.02680,
title = {Large Language Models are Geographically Biased},
author = {Rohin Manvi and Samar Khanna and Marshall Burke and David Lobell and Stefano Ermon},
journal= {arXiv preprint arXiv:2402.02680},
year = {2024}
}