Dolfin:无自编码器的扩散布局 Transformer
计算机视觉与模式识别
2023-10-26 v1 机器学习
摘要
在本文中,我们介绍了一种新颖的生成模型——无自编码器的扩散布局 Transformer(Dolfin),与现有方法相比,它以更低的复杂度显著提升了建模能力。Dolfin 采用基于 Transformer 的扩散过程来建模布局生成。除了高效双向(非因果联合)序列表示外,我们进一步提出了一种自回归扩散模型(Dolfin-AR),特别擅长捕捉相邻对象之间丰富的语义关联,如对齐、尺寸和重叠。在标准生成布局基准上评估时,Dolfin 在各项指标(fid、对齐、重叠、MaxIoU 和 DocSim 分数)上均显著提升性能,并在此过程中增强了透明性与可解释性。此外,Dolfin 的应用超越布局生成,适用于建模线段等几何结构。我们的实验给出了定性与定量结果以展示 Dolfin 的优势。
引用
@article{arxiv.2310.16305,
title = {Dolfin: Diffusion Layout Transformers without Autoencoder},
author = {Yilin Wang and Zeyuan Chen and Liangjun Zhong and Zheng Ding and Zhizhou Sha and Zhuowen Tu},
journal= {arXiv preprint arXiv:2310.16305},
year = {2023}
}