基于像素的语言建模
计算与语言
2023-04-27 v2 人工智能
计算机视觉与模式识别
机器学习
摘要
语言模型定义于有限的输入集合之上,这在我们试图扩展所支持语言的数量时造成了词汇瓶颈。应对该瓶颈会导致嵌入矩阵中可表示的内容与输出层中的计算问题之间的权衡。本文提出 PIXEL(Pixel-based Encoder of Language,基于像素的语言编码器),它不受上述任一问题困扰。PIXEL 是一种预训练语言模型,将文本渲染为图像,从而能够基于正字法相似性或像素的共激活实现跨语言表示迁移。PIXEL 被训练用于重建被掩码块的像素,而非预测词元上的分布。我们在与 BERT 相同的英语数据上预训练了含 86M 参数的 PIXEL 模型,并在包含多种非拉丁文字的类型学多样语言上的句法与语义任务上进行评估。我们发现,对于预训练数据中未出现的文字,PIXEL 在句法与语义处理任务上大幅优于 BERT,但在处理拉丁文字时 PIXEL 略弱于 BERT。此外,我们发现 PIXEL 比 BERT 对正字法攻击与语言语码转换更为鲁棒,进一步证实了以像素建模语言的优势。
引用
@article{arxiv.2207.06991,
title = {Language Modelling with Pixels},
author = {Phillip Rust and Jonas F. Lotz and Emanuele Bugliarello and Elizabeth Salesky and Miryam de Lhoneux and Desmond Elliott},
journal= {arXiv preprint arXiv:2207.06991},
year = {2023}
}
备注
ICLR 2023