中文

JPEG-LM:以规范编解码器表示实现LLM作为图像生成器

计算与语言 2024-08-22 v2 计算机视觉与模式识别 机器学习

摘要

近期在图像和视频生成领域的研究正采用自回归大语言模型架构,因其通用性以及可能易于集成到多模态系统中。将语言生成中的自回归训练应用于视觉生成的关键在于离散化——将图像和视频等连续数据表示为离散标记。常见的图像和视频离散化方法包括对原始像素值建模(耗时过长)或向量量化(需要复杂的先验训练)。在本工作中,我们提出直接通过规范编解码器(如JPEG、AVC/H.264)将图像和视频建模为计算机上保存的压缩文件。在不进行任何视觉特定修改的情况下,我们使用默认的Llama架构从头开始预训练JPEG-LM以生成图像,并以AVC-LM生成视频作为概念验证,通过直接输出JPEG和AVC格式中的压缩文件字节。图像生成评估表明,这种简单直接的方法比基于像素的建模和复杂的向量量化基线更有效(我们的方法在FID上降低了31%)。我们的分析表明,JPEG-LM在生成长尾视觉元素方面具有相对于向量量化模型的特殊优势。总体而言,我们表明使用规范编解码器表示可以降低语言生成与视觉生成之间的壁垒,促进未来关于多模态语言/图像/视频大语言模型的研究。

关键词

引用

@article{arxiv.2408.08459,
  title  = {JPEG-LM: LLMs as Image Generators with Canonical Codec Representations},
  author = {Xiaochuang Han and Marjan Ghazvininejad and Pang Wei Koh and Yulia Tsvetkov},
  journal= {arXiv preprint arXiv:2408.08459},
  year   = {2024}
}