中文

基于自注意力的对抗潜在自编码器用于结构化图像合成

计算机视觉与模式识别 2024-10-03 v2 计算工程、金融与科学 图像与视频处理

摘要

由深度生成模型(DGM)驱动的 generative engineering design 方法已被提出以辅助工业工程流程。在此类流程中,设计常以图像形式出现,例如蓝图、工程图纸和 CAD 模型,具体取决于细节程度。DGM 已成功用于自然图像的合成,例如动物、人脸和风景。然而,工业设计图像与自然场景有本质不同,它们包含丰富的结构模式与长程依赖,这对基于卷积的 DGM 而言难以生成。此外,DGM 驱动的生成过程通常由随机噪声输入触发,输出不可预测的样例,因而无法高效地进行工业设计探索。我们通过提出一种新颖模型——自注意力对抗潜在自编码器(SA-ALAE)来应对这些挑战,该模型能够生成复杂工程部件的可行设计图像。借助 SA-ALAE,用户不仅可以探索现有设计的新变体,还能通过在潜在空间中操作来控制生成过程。SA-ALAE 的潜力通过在真实汽车设计任务中生成工程蓝图得以展现。

关键词

引用

@article{arxiv.2307.10166,
  title  = {Adversarial Latent Autoencoder with Self-Attention for Structural Image Synthesis},
  author = {Jiajie Fan and Laure Vuaille and Hao Wang and Thomas Bäck},
  journal= {arXiv preprint arXiv:2307.10166},
  year   = {2024}
}

备注

18 pages, 8 figures