大语言模型作为神经语言学主体:性能与 competence 之间的差异
计算与语言
2025-07-15 v3
摘要
本研究探讨了大语言模型(LLM)关于 signifier(形式)和 signified(意义)的语言理解能力,通过区分两种 LLM 评估范式来实现:心理语言学和神经语言学。传统的心理语言学评估往往反映统计规则,可能不准确代表 LLM 的 true 语言 competence。我们引入神经语言学方法,采用一种新方法结合最小配对和诊断探针来分析模型各层的激活模式。该方法允许详细检查 LLM 如何表示形式和意义,以及这些表示在不同语言间是否一致。我们发现:(1)心理语言学和神经语言学方法揭示了语言 performance 与 competence 是有区别的;(2)直接概率测量可能不准确评估语言 competence;(3)指令调优对 competence 影响不大但能提升 performance;(4)LLM 在形式方面的 competence 和 performance 均高于意义。此外,我们引入新的概念最小配对数据集,用于中文(COMPS-ZH)和德语(COMPS-DE),补充了现有的英文数据集。
引用
@article{arxiv.2411.07533,
title = {Large Language Models as Neurolinguistic Subjects: Discrepancy between Performance and Competence},
author = {Linyang He and Ercong Nie and Helmut Schmid and Hinrich Schütze and Nima Mesgarani and Jonathan Brennan},
journal= {arXiv preprint arXiv:2411.07533},
year = {2025}
}