LogiStory:面向多图像故事可视化的逻辑感知框架
计算机视觉与模式识别
2026-03-31 v1 多智能体系统
摘要
生成连贯且具沟通能力的视觉序列(如图像序列和视频)仍是当前多模态系统面临的重大挑战。尽管在视觉质量和世界知识集成方面取得了进展,现有模型仍难以保持逻辑流程,常导致动作不连贯、叙事碎片化和情节线索不清晰。我们认为,这些问题源于对视觉逻辑缺乏关注,而视觉逻辑是视觉序列生成中尚未被充分探讨的关键维度,我们定义为字符、动作和场景在时间维度上的感知一致性和因果一致性。为弥合这一差距,我们提出了一种逻辑感知的多图像故事可视化框架,LogiStory。该框架围绕显式建模视觉逻辑这一核心创新展开。为实现这一思想,我们设计了一个多智能体系统,用于 grounding 角色、提取因果链并验证故事层面的一致性,将故事连贯性从图像生成的隐式副产品转化为显式的建模目标。该设计有效地将结构化故事规划与视觉生成相结合,显著提升了故事可视化中的叙事清晰度和视觉质量。此外,为评估生成能力,我们构建了 LogicTale 数据集,包含丰富标注的故事,强调因果推理和视觉逻辑可解释性。我们建立了全面的自动评估和人类评估协议,旨在衡量视觉逻辑和感知质量。实验表明,我们的方法在生成视觉故事的叙事逻辑方面取得了显著提升。这一工作为在更广泛的图像序列和视频生成任务中建模和强制执行视觉逻辑提供了基础步骤。
引用
@article{arxiv.2603.28082,
title = {LogiStory: A Logic-Aware Framework for Multi-Image Story Visualization},
author = {Chutian Meng and Fan Ma and Chi Zhang and Jiaxu Miao and Yi Yang and Yueting Zhuang},
journal= {arXiv preprint arXiv:2603.28082},
year = {2026}
}