中文

大语言模型中动词-副词结构的神经表征分析与可视化:基于BERT的语义与句法层次研究

计算与语言 2024-12-20 v1 人工智能

摘要

本研究探讨了基于Transformer架构的大型语言模型(LLM)中动词-副词组合的内部表征,具体考察这些模型如何在不同神经网络层面捕捉词汇和句法细微差别。采用BERT架构,我们分析其各层在多种动词-副词结构(如'agree on'、'come back'、'give up')中的表征效能。我们的 methodology 包括从英国国家语料库(British National Corpus)准备详细数据集,随后进行大规模模型训练和通过多维尺度(MDS)和广义判别值(GDV)计算进行输出分析。结果表明,BERT的中间层最有效地捕捉句法结构,不同动词类别之间的表征准确性存在显著变异。这些发现挑战了在神经网络处理语言元素时假设的常规均匀性,并暗示网络架构与语言表征之间存在复杂的相互作用。我们的研究有助于更好地理解深度学习模型如何理解和处理语言,为当前神经语言分析方法的潜力与局限性提供了见解。本研究不仅推进了计算语言学的知识,也促使进一步的研究针对增强语言精确性进行神经网络架构优化。

关键词

引用

@article{arxiv.2412.14670,
  title  = {Analysis and Visualization of Linguistic Structures in Large Language Models: Neural Representations of Verb-Particle Constructions in BERT},
  author = {Hassane Kissane and Achim Schilling and Patrick Krauss},
  journal= {arXiv preprint arXiv:2412.14670},
  year   = {2024}
}