CART:用于图像生成的组合式自回归Transformer
计算机视觉与模式识别
2025-11-13 v3 机器学习
摘要
我们提出了一种新颖的自回归图像生成方法,将图像建模为可解释视觉层的分层组合。虽然自回归模型在语言建模中取得了变革性的成功,但由于图像固有的空间依赖性,在视觉任务中复制这种成功仍具挑战。针对视觉任务的独特挑战,我们的方法(CART)通过语义上有意义的分解迭代地添加图像细节。我们通过在三种不同的分解策略上应用CART展示了其灵活性和普适性:(i) 基础-细节分解(Mumford-Shah平滑性),(ii) 内在分解(反照率/阴影),(iii) 镜面分解(漫反射/镜面反射)。这种下一细节策略优于传统的下一标记和下一尺度方法,提高了可控性、语义可解释性和分辨率可扩展性。实验表明,CART能生成视觉上引人注目的结果,同时支持结构化图像操纵,为基于物理或感知动机的图像分解的可控生成建模开辟了新方向。
引用
@article{arxiv.2411.10180,
title = {CART: Compositional Auto-Regressive Transformer for Image Generation},
author = {Siddharth Roheda and Rohit Chowdhury and Aniruddha Bala and Rohan Jaiswal},
journal= {arXiv preprint arXiv:2411.10180},
year = {2025}
}
备注
figures compressed to meet arxiv size limit