中文

ViSTA:用于文本到图像扩散模型的多模态适配器的视觉叙事

计算机视觉与模式识别 2026-01-19 v3

摘要

文本到图像扩散模型已取得显著成功,但生成用于视觉叙事的连贯图像序列仍然具有挑战性。一个关键挑战是有效利用所有先前的文本-图像对(称为历史文本-图像对),其为维持帧间一致性提供上下文信息。现有的自回归方法以所有过去文本-图像对为条件,但需要大量训练;而无训练的特定主体方法确保了一致性,但缺乏对叙事提示的适应性。为解决这些局限性,我们提出了文本到图像扩散模型的多模态历史适配器 ViSTA。它包括(1)一个多模态历史融合模块,用于提取相关的历史特征,以及(2)一个历史适配器,用于基于提取的相关特征条件化生成。我们还在推理过程中引入了一种显著历史选择策略,选择最显著的历史文本-图像对以提高条件化的质量。此外,我们提出采用基于视觉问答的度量 TIFA 来评估视觉叙事中的文本-图像对齐,为生成的图像提供更针对性和可解释的评估。在 StorySalon 和 FlintStonesSV 数据集上的评估表明,所提出的 ViSTA 模型不仅在帧间具有一致性,而且与叙事文本描述也具有良好的对齐。

关键词

引用

@article{arxiv.2506.12198,
  title  = {ViSTA: Visual Storytelling using Multi-modal Adapters for Text-to-Image Diffusion Models},
  author = {Sibo Dong and Ismail Shaheen and Maggie Shen and Rupayan Mallick and Sarah Adel Bargal},
  journal= {arXiv preprint arXiv:2506.12198},
  year   = {2026}
}

备注

Accepted to WACV 2026