质疑大语言模型的调查式回答
计算与语言
2024-12-10 v4
摘要
调查近来作为一种研究大语言模型的工具而广受欢迎。通过将模型的调查回答与人类参照群体的回答进行比较,研究者旨在推断当前语言模型最能代表的 demographics、政治观点或价值观。在这项工作中,我们基于美国人口普查局成熟的 American Community Survey,对这一方法学进行了批判性审视。使用事实上的标准提示方法对 43 种不同的语言模型进行评估,我们确立了两种主导模式。首先,模型的回答受排序与标注偏差的支配,例如偏向标注为字母“A”的调查回答。其次,当通过随机化答案顺序来校正这些系统性偏差时,所有模型无论规模或预训练数据如何,都趋向于均匀随机的调查回答。因此,与先前工作的推测相反,调查得出的对齐度量通常允许一种简单的解释:模型始终似乎更好地代表那些在任何所考虑的调查中聚合统计最接近均匀的子群体。
引用
@article{arxiv.2306.07951,
title = {Questioning the Survey Responses of Large Language Models},
author = {Ricardo Dominguez-Olmedo and Moritz Hardt and Celestine Mendler-Dünner},
journal= {arXiv preprint arXiv:2306.07951},
year = {2024}
}
备注
NeurIPS 2024