中文

对话导演:弥合多模态故事叙述中对话可视化的鸿沟

计算机视觉与模式识别 2024-12-31 v1

摘要

近期人工智能驱动的故事叙述的进展增强了视频生成和故事可视化。然而,由于脚本细节有限、物理上下文理解不足以及整合电影原则的复杂性,将以对话为中心的脚本转化为连贯的故事板仍然是一个重大挑战。为应对这些挑战,我们提出了对话可视化这一新任务,将对话脚本转化为动态的多视角故事板。我们引入了对话导演(Dialogue Director),一个无需训练的多模态框架,包含脚本导演、摄影师和故事板制作者。该框架利用大型多模态模型和基于扩散的架构,采用思维链推理、检索增强生成和多视角合成等技术,以提升脚本理解、物理上下文理解和电影知识整合。实验结果表明,对话导演在脚本解读、物理世界理解和电影原则应用方面优于现有最先进方法,显著提升了基于对话的故事可视化的质量和可控性。

关键词

引用

@article{arxiv.2412.20725,
  title  = {Dialogue Director: Bridging the Gap in Dialogue Visualization for Multimodal Storytelling},
  author = {Min Zhang and Zilin Wang and Liyan Chen and Kunhong Liu and Juncong Lin},
  journal= {arXiv preprint arXiv:2412.20725},
  year   = {2024}
}