预训练语言模型对某些地理人群的表征优于其他人群
计算与语言
2024-03-19 v1
摘要
本文测量了两大 LLM 家族在表征不同地理人群时的偏斜程度。我们使用空间探测任务和地理参考语料库,来测量 OPT 和 BLOOM 系列的预训练语言模型在多大程度上表征了全球各地不同的人群。结果表明,这些模型对某些人群的表征远好于其他人群。特别是,美国和英国的人群被表征得相当好,而南亚和东南亚的人群则表征不佳。分析表明,这两个模型家族在不同人群间很大程度上共享相同的偏斜。同时,这种偏斜不能完全由社会语言学因素、经济因素或地理因素来解释。这项分析的基本结论是,预训练模型并没有同等地表征世界人口:存在对特定地理人群的强烈偏斜。这一发现挑战了单一模型可以适用于所有人群的观点。
引用
@article{arxiv.2403.11025,
title = {Pre-Trained Language Models Represent Some Geographic Populations Better Than Others},
author = {Jonathan Dunn and Benjamin Adams and Harish Tayyar Madabushi},
journal= {arXiv preprint arXiv:2403.11025},
year = {2024}
}