MagicScroll:基于多层语义感知去噪的视觉叙事非典型长宽比图像生成
计算机视觉与模式识别
2023-12-19 v1
摘要
视觉叙事常使用画卷、连环画和全景图等非典型长宽比图像来创造富有表现力且引人入胜的叙事。尽管生成式 AI 取得了巨大成功并展现出重塑创意产业的潜力,但生成具有任意尺寸且风格、概念和布局可控的连贯且引人入胜的内容仍是一项挑战,而这些对于视觉叙事至关重要。为克服以往方法内容重复、风格不一致和缺乏可控性等缺点,我们提出了 MagicScroll,这是一个基于扩散的多层渐进式图像生成框架,具有新颖的语义感知去噪过程。该模型能够在对象、场景和背景层面上,利用文本、图像和布局条件对生成图像进行细粒度控制。我们还建立了首个面向视觉叙事的非典型长宽比图像生成基准,包含绘画、漫画和电影全景等媒介,并配有用于系统评估的自定义指标。通过对比和消融研究,MagicScroll 在契合叙事文本、提升视觉连贯性和吸引受众方面展现出可喜的结果。我们计划发布代码和基准,以期促进 AI 研究人员与视觉叙事创意从业者之间更好的合作。
关键词
引用
@article{arxiv.2312.10899,
title = {MagicScroll: Nontypical Aspect-Ratio Image Generation for Visual Storytelling via Multi-Layered Semantic-Aware Denoising},
author = {Bingyuan Wang and Hengyu Meng and Zeyu Cai and Lanjiong Li and Yue Ma and Qifeng Chen and Zeyu Wang},
journal= {arXiv preprint arXiv:2312.10899},
year = {2023}
}
备注
Project page: https://magicscroll.github.io/