中文

大语言模型中的代表性偏误:重新审视“真实的 Linda”案例

计算与语言 2024-07-24 v4 人机交互

摘要

尽管大语言模型(LLMs)在建模文本和生成类人文本方面展现出惊人的能力,但在实际操作中可能保留训练数据中蕴含的偏见。具体而言,大语言模型可能对一种常见的认知陷阱——代表性启发式(representativeness heuristic)——高度敏感。这种心理学概念指的是:人们倾向于根据事件是否类似于著名原型或典型例子来判断其发生概率,而非考虑更广泛的事实或统计证据。本研究探讨了代表性启发式对大语言模型推理能力的影响。我们构建了 ReHeAT(Representativeness Heuristic AI Testing)数据集,包含六类代表性启发式问题。实验表明,四个大语言模型在 ReHeAT 上的表现均显示出代表性启发式偏见。进一步分析发现,模型的推理步骤常常错误地基于刻板印象,而非问题描述本身。有趣的是,在提示中加入提醒模型运用已有知识的提示后,性能得以提升。这表明代表性启发式的独特性于传统偏见。即便大语言模型已掌握正确知识,仍可能因陷入认知陷阱而出错。这凸显了未来需聚焦于模型推理与决策中代表性启发式的研究,并开发相应解决方案的重要性。

关键词

引用

@article{arxiv.2404.01461,
  title  = {Will the Real Linda Please Stand up...to Large Language Models? Examining the Representativeness Heuristic in LLMs},
  author = {Pengda Wang and Zilin Xiao and Hanjie Chen and Frederick L. Oswald},
  journal= {arXiv preprint arXiv:2404.01461},
  year   = {2024}
}

备注

Published as a conference paper at COLM 2024