预训练语言模型中的语境化究竟发生在何处?
计算与语言
2023-12-12 v1 人工智能
摘要
预训练语言模型(PLMs)因其学习词语境化表示的能力,在众多NLP任务中持续取得成功(Ethayarajh, 2019)。BERT(Devlin et al., 2018)、ELMo(Peters et al., 2018)和其他PLMs通过文本语境编码词义,这与静态词嵌入不同,后者将单词的所有含义编码在单个向量表示中。在这项工作中,我们提出了一项研究,旨在定位PLM中词语境化具体发生的位置。为了找到这种词义转换的位置,我们使用定性和定量度量,研究了基础BERT uncased 12层架构(Devlin et al., 2018)中多义词的表示,该架构是一个在额外句子邻接目标上训练的掩码语言模型。
引用
@article{arxiv.2312.06514,
title = {Where exactly does contextualization in a PLM happen?},
author = {Soniya Vijayakumar and Tanja Bäumel and Simon Ostermann and Josef van Genabith},
journal= {arXiv preprint arXiv:2312.06514},
year = {2023}
}
备注
EMNLP 2023 BlackBloxNLP 2023 Workshop