中文

MangaFlow: 一个用于从故事到可控漫画生成的端到端智能体框架

计算机视觉与模式识别 2026-05-28 v1

摘要

端到端漫画生成是一项结构化的视觉叙事任务,需要故事分解、重复角色和场景定位、页面布局设计、分镜渲染、页面合成以及文字排版。然而,现有的生成模型通常执行直接的页面合成,将这些因素纠缠在单一的视觉输出中,限制了对布局几何、视觉参考和跨分镜一致性的精确控制。为了解决这些局限性,我们提出了MangaFlow,一个用于可控长篇漫画生成的智能体框架,它将漫画创作分解为规划、定位、布局构建、参考条件渲染、合成和文字放置。通过将布局和视觉参考视为显式的中间变量,MangaFlow既支持简单的文本到漫画生成,也支持更精确的用户控制漫画创作。这种设计将布局、视觉资产和文字排版暴露为可编辑的中间控制,用于细化分镜几何、参考和文字放置。为了支持长篇一致性,MangaFlow引入了一个故事章节记忆,将章节描述与相应的角色、场景和对象参考链接起来,以便在多个分镜中重复使用。我们进一步提出了一个元基准来评估布局可控性、视觉一致性和生成质量。实验表明,与直接生成基线相比,MangaFlow提高了布局遵循度和跨分镜一致性,同时支持灵活的人工控制。

关键词

引用

@article{arxiv.2605.28173,
  title  = {MangaFlow: An End-to-End Agentic Framework for Controllable Story to Manga Generation},
  author = {Muyao Wang and Zeke Xie and Yanhao Chen and Lixin Xiu and Hideki Nakayama},
  journal= {arXiv preprint arXiv:2605.28173},
  year   = {2026}
}