中文

分析大语言模型(LLMs)中的叙事处理:使用GPT4测试BERT

计算与语言 2024-05-06 v1 人工智能

摘要

通过语言传递和接收复杂信息的能力是人类独有的,也是传统、文化和多样化社会互动的基础。随着基于Transformer的大语言模型(LLMs)的颠覆性引入,人类不再是唯一能够“理解”和产生语言的实体。在本研究中,我们迈出了将LLMs用作模型以理解神经网络中语言处理基本机制的第一步,旨在对人类大脑如何进行语言处理做出预测并生成假设。为此,我们使用ChatGPT为十种不同叙事(伊索寓言)生成了七种不同的风格变体。我们将这些故事作为开源LLM BERT的输入,并使用多维缩放和聚类分析分析了BERT隐藏单元的激活模式。我们发现,隐藏单元的激活向量在BERT的较浅层(第1层)根据风格变体聚类,而在较深层(第4-5层)则根据叙事内容聚类。尽管BERT由12个堆叠并在大型文本语料库上训练的相同构建块组成,但不同层执行不同的任务。这是人类大脑的一个非常有用的模型,其中自相似结构,即大脑皮层的不同区域,可以具有不同的功能,因此非常适合以非常高效的方式处理语言。所提出的方法一方面有可能打开LLMs的黑箱,另一方面可能是揭示人类语言处理和一般认知背后神经过程的更进一步。

关键词

引用

@article{arxiv.2405.02024,
  title  = {Analyzing Narrative Processing in Large Language Models (LLMs): Using GPT4 to test BERT},
  author = {Patrick Krauss and Jannik Hösch and Claus Metzner and Andreas Maier and Peter Uhrig and Achim Schilling},
  journal= {arXiv preprint arXiv:2405.02024},
  year   = {2024}
}