模型参与拼字比赛:语言模型隐式学习 Token 的字符构成
计算与语言
2022-06-09 v2 人工智能
机器学习
摘要
标准预训练语言模型在子词 token 序列上运作,无法直接访问构成每个 token 字符串表示的字符。我们探测预训练语言模型的嵌入层,并表明模型在从未见过字符与 token 配对的情况下,在相当大程度上学会了整词 token 和子词 token 的内部字符构成。我们的结果表明,RoBERTa 的嵌入层包含足够的信息,能够准确拼写出高达三分之一的词汇,并在所有 token 类型上达到很高的平均字符 ngram 重叠度。我们进一步测试了用额外字符信息丰富子词模型是否能改善语言建模,并观察到该方法的训练曲线与不使用拼写增强的训练近乎一致。总体而言,我们的结果表明,语言建模目标激励模型隐式学习某种拼写概念,而显式教模型如何拼写似乎并不能提升其在此类任务上的表现。
引用
@article{arxiv.2108.11193,
title = {Models In a Spelling Bee: Language Models Implicitly Learn the Character Composition of Tokens},
author = {Itay Itzhak and Omer Levy},
journal= {arXiv preprint arXiv:2108.11193},
year = {2022}
}
备注
NAACL 2022