中文

一生万物:利用语言模型模拟人类样本

机器学习 2024-02-28 v1 计算与语言

摘要

我们提出并探讨了在社会科学研究中将语言模型作为特定人类子群体的有效代理加以研究的可能性。人工智能工具的实用与研究应用有时受限于有问题的偏见(如种族主义或性别歧视),这些偏见常被视为模型的均匀属性。我们表明,此类工具之一——GPT-3语言模型——内的“算法偏见”反而是细粒度且与人 demographics 相关的,意味着适当的调节将使其准确模拟来自广泛人类子群体的响应分布。我们称此性质为“算法保真度”并探究其在GPT-3中的程度。我们通过以美国多项大型调查中真实人类参与者的数千个社会人口背景故事为条件,创建“硅样本”。然后我们比较硅样本与人类样本,以证明GPT-3中包含的信息远超出表面相似性。它是细腻、多面的,并反映了表征人类态度的观念、态度与社会文化语境之间的复杂相互作用。我们建议,具有充分算法保真度的语言模型由此构成一种新颖而有力的工具,以推进对跨多个学科的人与社会的理解。

关键词

引用

@article{arxiv.2209.06899,
  title  = {Out of One, Many: Using Language Models to Simulate Human Samples},
  author = {Lisa P. Argyle and Ethan C. Busby and Nancy Fulda and Joshua Gubler and Christopher Rytting and David Wingate},
  journal= {arXiv preprint arXiv:2209.06899},
  year   = {2024}
}