LottieGPT:面向自回归生成的矢量动画分词化
计算机视觉与模式识别
2026-04-14 v1
摘要
尽管视频生成领域取得了快速进展,现有模型仍无法生成矢量动画,这是一种在互联网上占主导地位且高度表达性的多媒体形式。矢量动画具有分辨率独立性、紧凑性、语义结构以及可编辑的参数化运动表示,而当前的生成模型仅在栅格空间中运行,无法合成这些内容。与此同时,最近在大型多模态模型方面的进展显示出在生成结构化数据(如幻灯片、3D 网格、积木序列和室内布局)方面具有强大的能力,这表明原生矢量动画生成可能是可行的。在本工作中,我们提出了首个用于分词化和自回归生成矢量动画的框架。我们采用 Lottie,这是一种广泛部署的基于 JSON 的动画标准,并设计了针对性的 Lottie 分词器,将分层几何原语、变换和基于关键帧的运动编码为紧凑且语义对齐的 token 序列。为支持大规模训练,我们还构建了 LottieAnimation-660K,这是目前规模最大且最具多样性的矢量动画数据集,包含 66 万个真实世界的 Lottie 动画和 1500 万个静态 Lottie 图像文件,这些内容从广泛的互联网来源筛选而来。基于这些组件,我们对 Qwen-VL 进行微调,以创建 LottieGPT——一个能够直接从自然语言或视觉提示生成连贯且可编辑矢量动画的原生多模态模型。实验表明,我们的分词器显著减少了序列长度,同时保持结构保真度,使其能够有效地对动态矢量内容进行自回归学习。LottieGPT 在多样化的动画风格上表现出强大的泛化能力,并在 SVG 生成(矢量单帧动画的特例)上超越了之前的状态-of-the-art 模型。
引用
@article{arxiv.2604.11792,
title = {LottieGPT: Tokenizing Vector Animation for Autoregressive Generation},
author = {Junhao Chen and Kejun Gao and Yuehan Cui and Mingze Sun and Mingjin Chen and Shaohui Wang and Xiaoxiao Long and Fei Ma and Qi Tian and Ruqi Huang and Hao Zhao},
journal= {arXiv preprint arXiv:2604.11792},
year = {2026}
}
备注
Accepted by CVPR 2026. Project Page: https://lottiegpt.github.io/