基于GPT-2注意力模式的熵与距离预测因子可超越GPT-2惊奇度预测阅读时间
计算与语言
2022-12-22 v1
摘要
基于Transformer的大型语言模型通过自注意力机制聚合先前词元的表示来训练预测下一个词。在认知建模领域,此类注意力模式近来被解释为体现了基于线索的检索过程,其中对多个目标的注意力被认为会在检索过程中产生干扰与延迟。在此框架下,本文首先定义了一种基于熵的预测因子,用于量化自注意力的分散程度,以及基于距离的预测因子,用于捕捉跨时间步的注意力模式增量变化。此外,继近期质疑注意力权重信息量的研究之后,我们也尝试了将向量范数纳入注意力权重的替代方法。使用从GPT-2语言模型计算的预测因子进行的回归实验表明,相较于包含GPT-2惊奇度(surprisal)的严格基线,这些预测因子对留出集上的自定步速阅读与眼动追踪数据具有显著更好的拟合。此外,基于距离的预测因子通常表现出更高的预测力,在自定步速阅读时间上的效应量达每标准差6.59毫秒(惊奇度为2.82毫秒),在眼动注视时长上达每标准差1.05毫秒(惊奇度为3.81毫秒)。
引用
@article{arxiv.2212.11185,
title = {Entropy- and Distance-Based Predictors From GPT-2 Attention Patterns Predict Reading Times Over and Above GPT-2 Surprisal},
author = {Byung-Doh Oh and William Schuler},
journal= {arXiv preprint arXiv:2212.11185},
year = {2022}
}
备注
EMNLP 2022