中文

CBEval:评估与解释大语言模型中认知偏见的框架

计算与语言 2024-12-06 v1 人工智能 人机交互

摘要

大型语言模型 (LLMs) 的快速进步显著提升了其推理能力。尽管在基准测试中性能不断提高,但 LLMs 在认知过程方面仍存在显著差距。此外,作为人类生成数据反映的模型,LLMs 有望继承认知偏见,这引发对其推理与决策能力的广泛关注。本文提出了一个用于解释、理解并提供关于 LLMs 中各种认知偏见见解的框架。我们在前沿语言模型上开展研究,阐明了推理局限性和偏见,并通过构建影响图识别 LLMs 中最可能导致偏见显现的短语和词语。我们进一步探讨了圆数偏见和框架效应在语言模型中所揭示的认知偏见屏障。

关键词

引用

@article{arxiv.2412.03605,
  title  = {CBEval: A framework for evaluating and interpreting cognitive biases in LLMs},
  author = {Ammar Shaikh and Raj Abhijit Dandekar and Sreedath Panat and Rajat Dandekar},
  journal= {arXiv preprint arXiv:2412.03605},
  year   = {2024}
}