预训练语言模型对词元表面信息的知识
计算与语言
2024-02-23 v2
摘要
预训练语言模型是否具备关于词元表面信息的知识?我们从词元长度、子串和词元构成三个视角,考察了预训练语言模型所获得的词或子词嵌入中存储的表面信息。此外,我们评估了模型生成关于词元表面知识的能力。我们重点关注了 12 个主要在英语和日语语料库上训练的预训练语言模型。实验结果表明,预训练语言模型具备关于词元长度和子串的知识,但不具备关于词元构成的知识。此外,结果暗示在有效利用所获知识方面,解码器端存在瓶颈。
引用
@article{arxiv.2402.09808,
title = {Knowledge of Pretrained Language Models on Surface Information of Tokens},
author = {Tatsuya Hiraoka and Naoaki Okazaki},
journal= {arXiv preprint arXiv:2402.09808},
year = {2024}
}