中文

ART:用于变量多层透明图像生成的匿名区域转换器

计算机视觉与模式识别 2025-02-26 v1

摘要

多层图像生成是一项基本任务,使用户能够隔离、选择和编辑特定图像图层,从而革新了与生成模型的交互方式。本文引入了 Anonymous Region Transformer(ART),它基于全局文本提示和匿名区域布局,实现可变多层透明图像的直接生成。灵感来源于模式理论,后者认为知识以框架(模式)组织,使人类能够通过将新信息与先前知识关联来解释和学习新信息。这种匿名区域布局允许生成模型自主确定哪组视觉标记应与哪组文本标记对齐,这与此前主导的语义布局图像生成任务形成鲜明对比。此外,layer-wise 区域裁剪机制仅选择属于每个匿名区域的视觉标记,显著降低注意力计算成本,使能够高效生成大量不同图层的图像(例如 50+)。与全注意力方法相比,我们的方法快 12 倍以上,层级冲突更少。 Furthermore,我们提出了一种高质量的多层透明图像自编码器,支持对变量多层图像透明度的联合编码和解码。通过实现精确控制和可扩展的图层生成,ART 建立了一种新的交互式内容创建范式。

关键词

引用

@article{arxiv.2502.18364,
  title  = {ART: Anonymous Region Transformer for Variable Multi-Layer Transparent Image Generation},
  author = {Yifan Pu and Yiming Zhao and Zhicong Tang and Ruihong Yin and Haoxing Ye and Yuhui Yuan and Dong Chen and Jianmin Bao and Sirui Zhang and Yanbin Wang and Lin Liang and Lijuan Wang and Ji Li and Xiu Li and Zhouhui Lian and Gao Huang and Baining Guo},
  journal= {arXiv preprint arXiv:2502.18364},
  year   = {2025}
}

备注

Project page: https://art-msra.github.io/