中文

PIXAR:像素空间中的自回归语言建模

计算与语言 2024-02-27 v2

摘要

近期的工作展示了构建直接操作像素表示的开词汇大型语言模型(LLMs)的可能性。这些模型被实现为自编码器,用于重建渲染文本的掩码补丁。然而,这些基于像素的 LLM 仅限于判别式任务(例如分类),并且类似于 BERT,无法用于生成文本。因此,它们不能用于自由形式问答等生成式任务。在本工作中,我们介绍了 PIXAR,这是第一个执行文本生成的基于像素的自回归 LLM。PIXAR 仅由解码器组成,能够在保持参数量与之前的编码器 - 解码器模型相当的同时,执行自由形式的生成任务。此外,我们强调了将文本生成为非噪声图像的挑战,并指出这是由于使用了最大似然目标所致。为克服这一问题,我们提出了一种对抗性预训练阶段,使 PIXAR 在 LAMBADA 上的可读性和准确性提高了 8.1,在 bAbI 上提高了 8.5,使其在文本生成任务上与 GPT-2 相当。这为构建仅操作感知输入的开词汇 LLM 铺平了道路,并对通常的符号输入表示(即作为(子)标记的文本)的必要性提出了质疑。

关键词

引用

@article{arxiv.2401.03321,
  title  = {PIXAR: Auto-Regressive Language Modeling in Pixel Space},
  author = {Yintao Tai and Xiyang Liao and Alessandro Suglia and Antonio Vergari},
  journal= {arXiv preprint arXiv:2401.03321},
  year   = {2024}
}