中文

LLM 生成调查中的公平性

计算机与社会 2025-01-28 v1 机器学习

摘要

大型语言模型 (LLM) 在文本生成和理解方面卓越,尤其擅长模拟社会政治和经济模式,作为传统调查的替代方案。然而,其在跨社会人口和地理语境的全球适用性仍存疑虑,因未探索这些背景下的偏见。本研究通过分析来自智利和美国的公共调查数据,关注 LLM 在不同人口中的预测准确性和公平性指标。结果显示,LLM 在美国数据集上始终表现出性能差异。这种偏见源于以美国为中心的训练数据,尽管控制了社会人口差异,偏见仍显而易见。在美国,政治身份和种族显著影响预测准确性,而在智利,性别、教育和宗教信仰在预测准确性中发挥更突出的作用。我们的研究提出了一种新型框架,用于衡量 LLM 中的社会人口偏见,为确保在不同社会文化语境中实现更公平、更均衡的模型性能提供了道路。

关键词

引用

@article{arxiv.2501.15351,
  title  = {Fairness in LLM-Generated Surveys},
  author = {Andrés Abeliuk and Vanessa Gaete and Naim Bro},
  journal= {arXiv preprint arXiv:2501.15351},
  year   = {2025}
}