机制 vs. 结果:探讨语法在针对性语法评估中的解释能力
计算与语言
2025-11-11 v2
摘要
大型语言模型 (LLM) 在处理和生成文本时表现出对语法的强大掌握,这表明它们内部化了分层语法和依赖关系的理解,但 precisely 哪种机制导致它们表示语法结构仍是一个开放的可解释性研究领域。探测方法提供了一种识别语法线性编码在激活中的机制的方式,但尚无综合性研究确立探测准确率是否可靠地预测其下游语法性能。采用“机制 vs. 结果”框架,我们评估了 32 个开源变换器模型,发现通过探测提取的语法特征未能预测针对英语语言现象的针对性语法评估的结果。我们的结果凸显了通过探测发现的潜在语法表示与下游任务中可观察到的语法行为之间的显著鸿沟。
引用
@article{arxiv.2506.16678,
title = {Mechanisms vs. Outcomes: Probing for Syntax Fails to Explain Performance on Targeted Syntactic Evaluations},
author = {Ananth Agarwal and Jasper Jian and Christopher D. Manning and Shikhar Murty},
journal= {arXiv preprint arXiv:2506.16678},
year = {2025}
}