中文

AttriStory:基于扩散模型的视觉叙事中细粒度属性实现

计算机视觉与模式识别 2026-05-21 v1

摘要

扩散模型用于视觉叙事在保持叙事场景中人物一致性方面取得了显著进展。然而仍存在关键性差距:尽管这些方法确保人物在不同场景中保持一致,但未提供系统方法以确保细粒度属性(如服装、配饰的颜色和纹理)在生成图像中的忠实呈现。为此目标,我们引入 AttriStory,一个用于视觉叙事中属性实现的基准数据集。我们使用大语言模型构建了包含 10 种不同艺术风格的 200 组多场景故事。每场叙事都包含详细的属性规范,以实现丰富的视觉叙事。进一步地,为解决属性实现问题,我们提出一种插拨式潜在优化模块, operates于去噪的早期步骤,当模型建立结构和语义内容时。我们通过 AttriLoss 目标函数实现这一点,该目标函数最大化所需属性-对象对的交叉注意力图之间的对齐度,同时抑制不正当关联,引导模型正确局部化属性。该方法在现有一致性机制之上运行,无需架构修改即可无缝集成到当前的故事生成管道中。我们的实验表明,在所有基线方法上采用 AttriLoss 均能实现一致的改进。本工作将属性实现定位为视觉叙事的一种独立、补充维度,除人物一致性外,推动该领域向细粒度属性受控故事生成发展。项目页面:https://manogna-s.github.io/attristory/

关键词

引用

@article{arxiv.2605.20777,
  title  = {AttriStory: Fine-grained Attribute Realization for Visual Storytelling with Diffusion Models},
  author = {Manogna Sreenivas and Rohit Kumar and Soma Biswas},
  journal= {arXiv preprint arXiv:2605.20777},
  year   = {2026}
}

备注

Accepted at CVPR AIStory Workshop, 2026