语言模型如何优先考虑上下文语法线索?
计算与语言
2024-10-07 v1
摘要
基于Transformer的语言模型表现出卓越的能力,能够有效捕获和利用上下文信息。虽然已有多种分析技术用于量化和追踪单个上下文线索对特定任务(如主谓一致或指代消解)的贡献,但在多个相关线索同时存在于上下文中的情形仍未得到充分探讨。本文我们研究语言模型在处理性别一致性时的行为,当上下文中存在多个能够独立消化目标性别代词的性别线索时。我们分析两种广泛使用的Transformer模型:BERT(基于编码器)和GPT-2(基于解码器)。我们的分析采用两种互补方法:上下文混合分析,用于追踪模型内部的信息流;以及变体化的激活修补,用于衡量线索对模型预测的影响。我们发现BERT倾向于优先考虑上下文中的第一个线索来构建目标词表示和模型预测,而GPT-2更依赖于最后一个线索。我们的发现揭示了基于编码器和基于解码器的模型在处理上下文信息时的显著差异。
引用
@article{arxiv.2410.03447,
title = {How Language Models Prioritize Contextual Grammatical Cues?},
author = {Hamidreza Amirzadeh and Afra Alishahi and Hosein Mohebbi},
journal= {arXiv preprint arXiv:2410.03447},
year = {2024}
}
备注
Accepted to BlackboxNLP 2024