词元对其字符了解多少,又是如何了解的?
计算与语言
2022-06-07 v1
摘要
使用子词分词方案预训练的语言模型(PLMs)能够在需要字符级信息的各种语言任务上取得成功,尽管它们缺乏对标符字符组成的显式访问。在此,通过研究一系列模型(如 GPT-J、BERT、RoBERTa、GloVe),我们通过训练分类器基于词元嵌入预测词元中特定字母字符的存在与否(例如,探查“cat”的模型嵌入是否编码了其包含字符“a”),来探查词片编码了哪些字符级信息。我们发现这些模型稳健地编码了字符级信息,且一般而言,更大的模型在该任务上表现更好。我们表明这些结果可推广到非拉丁字母表中的字符(阿拉伯文、梵文和西里尔文)。然后,通过一系列实验和分析,我们研究了 PLM 在训练期间获取英语字符信息的机制,并认为该知识是通过多种现象获得的,包括特定字符与特定词性之间的系统性关系,以及相关字符串分词中的自然变异性。
引用
@article{arxiv.2206.02608,
title = {What do tokens know about their characters and how do they know it?},
author = {Ayush Kaushal and Kyle Mahowald},
journal= {arXiv preprint arXiv:2206.02608},
year = {2022}
}