中文

探讨 LLM 的错误共识效应

人机交互 2025-02-11 v2 人工智能 计算与语言

摘要

大型语言模型 (LLM) 最近被采纳用于需要交互式通信的系统。由于模型中存在错误信念会损害此类系统的可用性,LLM 不应具有人类所具有的认知偏见。心理学家特别关注错误共识效应 (FCE),这是一种认知偏见,其中个体高估他人共享其信念或行为的程度,因为 FCE 可能通过提出错误信念来干扰顺畅的沟通。然而,先前的研究较少全面地考察 LLM 中的 FCE,这需要更深入地考虑混杂偏见、一般情况以及提示词变化。因此,本文进行了两项研究来检验 LLM 中的 FCE 现象。在研究 1 中,我们检验 LLM 是否具有 FCE。在研究 2 中,我们探讨各种提示风格如何影响 FCE 的表现。研究结果表明,流行的 LLM 具有 FCE。此外,结果指定了 FCE 在何种情况下比正常使用更常见或更少见的条件。

关键词

引用

@article{arxiv.2407.12007,
  title  = {People will agree what I think: Investigating LLM's False Consensus Effect},
  author = {Junhyuk Choi and Yeseon Hong and Bugeun Kim},
  journal= {arXiv preprint arXiv:2407.12007},
  year   = {2025}
}

备注

NAACL 2025 Findings