大型语言模型与大脑中上下文特征提取层级的趋同
计算与语言
2024-12-10 v1 人工智能
神经元与认知
摘要
人工智能的最新进展引发了人们对大型语言模型(LLMs)与人类神经处理之间相似性的兴趣,特别是在语言理解方面。尽管先前的研究已经确立了 LLMs 与大脑在表征上的相似性,但导致这种趋同的潜在计算原理,尤其是在 LLMs 不断演进的背景下,仍然难以捉摸。在此,我们考察了多种具有相似参数量的高性能 LLMs,以研究促使其与大脑语言处理机制对齐的因素。我们发现,随着 LLMs 在基准任务上取得更高性能,它们不仅变得更加类脑(通过从 LLM 嵌入预测神经响应时的更高性能来衡量),而且其层级特征提取通路更紧密地映射到大脑的通路上,同时使用更少的层数来完成相同的编码。我们还相互比较了 LLMs 的特征提取通路,并确定了高性能模型趋同于相似层级处理机制的新方式。最后,我们展示了上下文信息在提高模型性能和类脑相似性方面的重要性。我们的发现揭示了大脑和 LLMs 中语言处理的趋同方面,并为开发更紧密对齐人类认知处理的模型提供了新方向。
引用
@article{arxiv.2401.17671,
title = {Contextual Feature Extraction Hierarchies Converge in Large Language Models and the Brain},
author = {Gavin Mischler and Yinghao Aaron Li and Stephan Bickel and Ashesh D. Mehta and Nima Mesgarani},
journal= {arXiv preprint arXiv:2401.17671},
year = {2024}
}
备注
19 pages, 5 figures and 4 supplementary figures