中文

基于统一多模态大语言模型的定制化视觉叙事

计算机视觉与模式识别 2026-03-31 v1

摘要

多模态故事定制旨在根据文本描述、参考身份图像和镜头类型生成连贯的故事流。尽管故事生成方面的近期进展已展现出有前景的结果,但大多数方法依赖于纯文本输入。少数研究结合了角色身份线索(如面部 ID),但缺乏更广泛的多模态条件输入。在本工作中,我们提出了 VstoryGen,一个多模态框架,将描述与角色和背景参考相结合,以实现可定制的故事生成。为增强电影多样性,我们通过基于电影数据的参数高效提示调优引入镜头类型控制,使模型能够生成更忠实反映电影语法的序列。为评估我们的框架,我们建立了两个新基准,从角色与场景一致性、文本-视觉对齐和镜头类型控制的角度评估多模态故事定制。实验表明,VstoryGen 在一致性和电影多样性方面优于现有方法。

关键词

引用

@article{arxiv.2603.27690,
  title  = {Customized Visual Storytelling with Unified Multimodal LLMs},
  author = {Wei-Hua Li and Cheng Sun and Chu-Song Chen},
  journal= {arXiv preprint arXiv:2603.27690},
  year   = {2026}
}

备注

Paper accepted to the CVPR 2026 Workshop on Generative AI for Storytelling (CVPRW)