中文

大型语言模型中的元认知迟疑

人工智能 2024-08-13 v1 计算与语言 计算机与社会 应用统计

摘要

大型语言模型(LLMs)表现出可能有害的偏见,这些偏见强化了文化内在的刻板印象,模糊了道德判断,或放大了对多数群体的积极评价。以往的解释主要将LLM偏见归因于人类标注者以及训练数据的选择,从而通常采用自上而下的方法(如强化学习或去偏营养数据)加以解决。然而,这些方法仅通过间接影响模型架构来处理LLM偏见的现象,却未能解决计算过程中潜在原因。本文提出“元认知迟疑”作为解释LLM偏见的认知生态框架,旨在解释既存及新兴的LLM偏见,并提供解决强大但脆弱工具问题的杠杆。我们的理论框架认为,缺乏两种元认知组成部分(即监控与控制)导致LLM出现五种元认知迟疑症状:无效标记和嵌入的整合、对冗余信息的易受性、忽视条件计算中的基准率、基于频率的决策规则,以及对嵌套数据结构进行不恰当的高阶统计推断。因此,LLMs产生错误输出,影响到人类的日常重大决策。通过在LLMs中引入元认知调节过程,工程师和科学家可为解决这些偏见的根本原因制定精确的补救措施。我们的理论为人机交互中的缺陷问题提供了新视角,提升了日益不慎地将LLMs实施于组织结构中的伦理关切。

关键词

引用

@article{arxiv.2408.05568,
  title  = {Metacognitive Myopia in Large Language Models},
  author = {Florian Scholten and Tobias R. Rebholz and Mandy Hütter},
  journal= {arXiv preprint arXiv:2408.05568},
  year   = {2024}
}