中文

BOOKAGENT:通过多智能体认知校准实现安全感知的视觉叙事编排

计算机视觉与模式识别 2026-04-21 v1

摘要

近期大型生成模型(LGM)的快速发展彻底改变了多模态生成的格局。然而,生成插图故事书仍是开放性挑战,其中先前的工作主要将此任务分解为离散阶段,从而导致整体多模态对齐受限。此外,虽然针对文本或图像单模态生成的安全对齐已受到研究,但现有工作很少将儿童特定的安全约束整合到叙事规划和序列级多模态验证中。为此,我们提出 BookAgent,一个面向高质量、安全感知视觉叙事的多智能体协作框架。与先前的故事可视化模型不同,BookAgent 旨在从用户草稿中进行端到端的故事书合成,通过联合规划、编写、绘图和全局修复不一致性来实现。为确保精确的多模态对齐,BookAgent 动态校准页面级别的文本脚本与视觉布局之间的对齐。此外,BookAgent 通过验证-修复方式,从时间维度上校准整体一致性,对角色身份和叙事逻辑的全局不一致性进行验证后矫正。广泛的实验表明,BookAgent 在叙事连贯性、视觉一致性和安全合规性方面显著优于当前方法,为可靠的复杂多模态创作代理提供了健壮范式。该实现将在 https://github.com/bogao-code/BookAgent/tree/main 上公开发布。

关键词

引用

@article{arxiv.2604.16541,
  title  = {BOOKAGENT: Orchestrating Safety-Aware Visual Narratives via Multi-Agent Cognitive Calibration},
  author = {Bo Gao and Chang Liu and Yuyang Miao and Siyuan Ma and Ser-Nam Lim},
  journal= {arXiv preprint arXiv:2604.16541},
  year   = {2026}
}

备注

18 pages, Accepted by ACL 2026