揭示语言能力神经元:基于心理语言学的方法论模型可解释性
计算与语言
2024-12-12 v2
摘要
随着大型语言模型(LLM)在其语言能力方面的不断进步,理解它们如何捕捉语言能力的各个方面仍然是一个重要挑战。因此,本研究运用心理语言学范式(以英语为主),这些范式非常适合探究语言处理中更深层的认知方面,以探索语言模型在三个任务中的神经元级表征:语音-形状关联、语音-性别关联以及隐式因果性。我们的发现表明,GPT-2-XL在语音-形状任务中表现不佳,但在语音-性别关联和隐式因果性方面展现出类似人类的能力。针对性的神经元消失和激活操作揭示了一个关键关系:当GPT-2-XL表现出一种语言能力时,特定神经元对应于该能力;相反,缺乏这种能力则表明缺乏专门的神经元。本研究是首次利用心理语言学实验在神经元水平上探讨深层语言能力,为模型可解释性提供了新的粒度,并提供了关于基于Transformer架构大型语言模型内部机制驱动语言能力的见解。
引用
@article{arxiv.2409.15827,
title = {Unveiling Language Competence Neurons: A Psycholinguistic Approach to Model Interpretability},
author = {Xufeng Duan and Xinyu Zhou and Bei Xiao and Zhenguang G. Cai},
journal= {arXiv preprint arXiv:2409.15827},
year = {2024}
}