大语言模型是否表现出类人响应偏差?以调查设计为例
计算与语言
2024-02-07 v5
摘要
随着大语言模型(LLMs)能力增强,人们越来越期待在需要主观标签的真实世界任务(如调查与民意测验)中使用LLM作为人类代理。采用LLM作为主观任务中人类代理的一个被广泛提及的障碍是它们对提示措辞的敏感性——但有趣的是,人类也表现出以响应偏差形式的指令变化敏感性。我们研究LLM在多大程度上反映人类响应偏差(若有)。我们借鉴调查设计,其中由“提示”措辞变化引起的人类响应偏差已在社心文献中被广泛探讨。借鉴这些工作,我们设计了一个数据集与框架,以评估LLM在调查问卷中是否展现类人响应偏差。我们对九个模型的综合评估表明,流行的开源与商业LLM普遍无法反映类人行为,尤其在经过RLHF的模型中。此外,即使某模型显示出与人类同方向的显著变化,我们发现它们对不引发人类显著变化的扰动敏感。这些结果凸显了使用LLM作为人类代理的陷阱,并强调需要对模型行为进行更细粒度刻画。我们的代码、数据集与收集样本见 https://github.com/lindiatjuatja/BiasMonkey
引用
@article{arxiv.2311.04076,
title = {Do LLMs exhibit human-like response biases? A case study in survey design},
author = {Lindia Tjuatja and Valerie Chen and Sherry Tongshuang Wu and Ameet Talwalkar and Graham Neubig},
journal= {arXiv preprint arXiv:2311.04076},
year = {2024}
}