中文

MALeR:提高布局引导生成中的组成性保真度

计算机视觉与模式识别 2025-11-11 v1

摘要

最近的文本到图像模型的进展催生了一种新的创意和可控图像生成时代。然而,生成包含多个主题和属性的组合场景仍然是一个重大挑战。为增强用户对主题放置的控制,已提出多种布局引导方法。然而,这些方法在组合场景中面临诸多挑战,尤其是意外主题会出现在布局之外,生成的图像可能不符合分布并包含不自然的痕迹,或属性在主题之间泄漏,导致视觉输出不正确。本文提出了 MALeR 方法,以解决上述挑战。给定文本提示和相应的布局,本方法可防止主题出现在给定布局之外,同时保持分布一致性。此外,我们提出一种掩码化、属性感知的绑定机制,以防止属性泄漏,实现即使在复杂组合场景中,也能准确渲染具有多个属性的主题。定性和定量评估表明,我们的方法在组成准确性、生成一致性和属性绑定方面优于先前工作。MALeR 在生成包含多个主题且每个主题具有多个属性的场景时尤为出色。

关键词

引用

@article{arxiv.2511.06002,
  title  = {MALeR: Improving Compositional Fidelity in Layout-Guided Generation},
  author = {Shivank Saxena and Dhruv Srivastava and Makarand Tapaswi},
  journal= {arXiv preprint arXiv:2511.06002},
  year   = {2025}
}

备注

ACM TOG Dec 2025, Siggraph Asia, Project page: https://katha-ai.github.io/projects/maler/