中文

BERT 处理与表示论证结构建构性的分析

计算与语言 2024-08-09 v1

摘要

本研究探讨了 BERT 如何处理和表示论证结构建构性 (ASCs),扩展了对 LSTM 的先前分析。我们使用包含 2000 句话、涵盖四种 ASC 类型(及物、双及物、导致运动、结果)的数据集,分析了 BERT 在 12 层中的 token 嵌入。借助 MDS 和 t-SNE 可视化技术,以及以广义判别值 (GDV) 为度量的聚类分析,我们使用前馈分类器(探针)从嵌入中预测建构性类别。CLS token 嵌入在第 2-4 层中聚类最好,随后在中间层中下降,在最终层中略有增加。DET 和 SUBJ 嵌入在中间层中表现出一致的聚类,VERB 嵌入则随层数从第 1 层到第 12 层不断增加聚类,OBJ 嵌入在第 10 层聚类达到高峰。探针准确率表明,第 1 层的建构性信息极低,而从第 2 层开始准确率超过 90%,揭示了 GDV 聚类之外潜在的建构性信息。对注意力权重的 FDR 分析显示,OBJ token 对区分 ASCs 至关重要,其次是 VERB 和 DET token,而 SUBJ、CLS 和 SEP token 的 FDR 分数不显著。本研究突显了 BERT 对语言建构性的分层处理及其与 LSTM 的差异。未来研究将将这些发现与神经影像数据进行比较,以理解 ASC 处理的神经关联。本研究凸显了神经语言模型在镜像人类大脑语言处理方面的潜力,为理解语言理解背后计算和神经机制提供了见解。

关键词

引用

@article{arxiv.2408.04270,
  title  = {Analysis of Argument Structure Constructions in the Large Language Model BERT},
  author = {Pegah Ramezani and Achim Schilling and Patrick Krauss},
  journal= {arXiv preprint arXiv:2408.04270},
  year   = {2024}
}

备注

arXiv admin note: text overlap with arXiv:2408.03062