反事实干预揭示关系从句表征对一致预测的预测因果效应
计算与语言
2021-09-16 v3
摘要
当语言模型处理句法复杂的句子时,它们是否以符合语言语法的方式使用其句法表征?我们提出AlterRep,一种基于干预的方法来解决这个问题。对于给定句子的任何语言特征,AlterRep通过更改该特征的编码方式生成反事实表征,同时保持原始表征的所有其他方面不变。通过测量当这些反事实表征替换原始表征时模型词预测行为的变化,我们可以得出关于所讨论语言特征对模型行为的因果效应的结论。我们应用该方法研究不同规模的BERT模型如何处理关系从句(RCs)。我们发现BERT变体在词预测过程中使用RC边界信息的方式与英语语法规则一致;这种RC边界信息在不同RC类型间在很大程度上泛化,表明BERT将RCs表示为一个抽象语言范畴。
引用
@article{arxiv.2105.06965,
title = {Counterfactual Interventions Reveal the Causal Effect of Relative Clause Representations on Agreement Prediction},
author = {Shauli Ravfogel and Grusha Prasad and Tal Linzen and Yoav Goldberg},
journal= {arXiv preprint arXiv:2105.06965},
year = {2021}
}
备注
Equal contribution by SR and GP. Accepted in CoNLL 2021