中文

真实性偏差及其超越:揭示大语言模型在问题求解推理中的隐藏信念

计算与语言 2025-05-27 v2

摘要

尽管大语言模型(LLMs)明确对齐了针对人口统计刻板印象的规范,但已有研究表明它们在各种社会语境下仍会表现出偏差。在本工作中,我们发现 LLMs 在将解答真实性与人口统计特征相关联时表现出令人担忧的偏差。通过在数学、编程、常识和写作问题上对五个与人类价值观对齐的 LLMs 进行实验,我们揭示了两种此类真实性偏差:归因偏差,即模型不成比例地将正确解答归因于特定人口群体;以及评估偏差,即模型对相同解答的评估会因感知到的作者人口统计特征而异。我们的结果显示偏差普遍存在:在数学和编程任务中,LLMs 始终将更少的正确解答和更多的错误解答归因于非裔美国人群体,而在写作评估中,亚裔作者身份最不受青睐。在附加研究中,我们发现 LLMs 在可视化代码中会自动为人口群体分配具有种族刻板印象的颜色,这表明这些偏见已深深嵌入模型的推理过程。我们的发现表明,人口统计偏差已超越表面层次的刻板印象和社会语境触发,引发了对 LLMs 在教育和评估场景中部署的担忧。

关键词

引用

@article{arxiv.2505.16128,
  title  = {Veracity Bias and Beyond: Uncovering LLMs' Hidden Beliefs in Problem-Solving Reasoning},
  author = {Yue Zhou and Barbara Di Eugenio},
  journal= {arXiv preprint arXiv:2505.16128},
  year   = {2025}
}

备注

Accepted to ACL 2025 (Main)