中文

Heptapod:基于视觉信号的语言建模

计算机视觉与模式识别 2025-10-09 v1 人工智能

摘要

我们提出 Heptapod,一种遵循语言建模基本原则的图像自回归模型。Heptapod 采用 causal attention、消除对 CFG 的依赖,以及摒弃语义化 tokenizer 的趋势。我们的关键创新是 next 2D distribution prediction:一种具有重建导向视觉 tokenizer 的因果 Transformer,学习在每个时间步预测整个 2D 空间网格图像的分布。这种学习目标统一了自回归框架的序列建模与掩码自编码的整体自监督学习,使模型能够通过生成训练捕获全面图像语义。在 ImageNet 生成基准测试中,Heptapod 实现了 FID 为 2.70,显著优于以前的因果自回归方法。我们希望我们的工作能启发人们对视觉信号乃至更广泛范围内的语言建模进行原则性的重新思考。

关键词

引用

@article{arxiv.2510.06673,
  title  = {Heptapod: Language Modeling on Visual Signals},
  author = {Yongxin Zhu and Jiawei Chen and Yuanzhe Chen and Zhuo Chen and Dongya Jia and Jian Cong and Xiaobin Zhuang and Yuping Wang and Yuxuan Wang},
  journal= {arXiv preprint arXiv:2510.06673},
  year   = {2025}
}