并非所有模型都将语言知识定位于同一处:对 BERToids 表示的逐层探测
计算与语言
2021-09-16 v2 人工智能
摘要
近期大多数关于探测表示的工作都聚焦于 BERT,并假定发现可能与其他模型相似。在本工作中,我们将探测研究扩展到该家族的另外两个模型,即 ELECTRA 和 XLNet,表明预训练目标或架构选择上的差异可导致在表示中编码语言信息的行为不同。最显著的是,我们观察到 ELECTRA 倾向于在较深层编码语言知识,而 XLNet 则将其集中于较早层。并且,前者在微调期间经历轻微变化,而后者经历显著调整。此外,我们表明基于权重混合评估策略——在逐层探测语境中广泛使用——得出结论可能产生误导,因为不同层表示的范数差异。作为替代,我们采用一种基于最小描述长度的信息论探测,其近来已被证明可提供更可靠且更具信息量的结果。
引用
@article{arxiv.2109.05958,
title = {Not All Models Localize Linguistic Knowledge in the Same Place: A Layer-wise Probing on BERToids' Representations},
author = {Mohsen Fayyaz and Ehsan Aghazadeh and Ali Modarressi and Hosein Mohebbi and Mohammad Taher Pilehvar},
journal= {arXiv preprint arXiv:2109.05958},
year = {2021}
}
备注
Accepted to BlackboxNLP Workshop at EMNLP 2021