中文

缓解随机硅采样中的社会愉好偏差

计算与语言 2025-12-30 v1 计算机与社会

摘要

大型语言模型(LLM)日益用于模拟人口响应,这种方法称为“硅采样”。然而,针对社会敏感问题的回答常常表现出社会愉好偏差(Social Desirability Bias, SDB),与真实人类数据相比更趋向于社会可接受的答案。现有关于LLM基于采样的社会愉好偏差研究仍有限。本文我们研究是否存在通过最小化、基于心理学的提示词措辞来缓解这一偏差,并提高硅样本与人类样本之间的对齐程度。我们使用美国选举研究(ANES)数据,对来自两个模型系列的三个LLM(开源的Llama-3.1系列和GPT-4.1-mini)进行研究。我们首先复现了基线硅采样研究,确认了持续存在的社会愉好偏差。随后我们测试了四种基于提示词的缓解方法:reformulated(中性、第三人称表述)、reverse-coded(语义反转)以及两个元指令,分别为priming和preamble,鼓励分析和诚实。使用Jensen-Shannon散度(JSD)并结合自助置信区间评估与ANES的对齐程度。我们的结果表明,reformulated提示词最有效地改善了对齐,通过减少对社会可接受答案的分布集中度,使分布更接近ANES。reverse-coding在不同合格项目上产生了混合结果,而Priming和Preamble鼓励了响应的一致性,对缓解偏差没有系统性益处。我们的发现验证了基于提示词的框架控制在缓解LLM内在社会愉好偏差方面的有效性,为实现更具代表性的硅采样提供了实际路径。

关键词

引用

@article{arxiv.2512.22725,
  title  = {Mitigating Social Desirability Bias in Random Silicon Sampling},
  author = {Sashank Chapala and Maksym Mironov and Songgaojun Deng},
  journal= {arXiv preprint arXiv:2512.22725},
  year   = {2025}
}

备注

31 pages, 9 figures, and 24 tables