中文

StoryTailor:面向动作丰富多主体视觉叙事的零样态管线

计算机视觉与模式识别 2026-03-09 v2

摘要

在不进行微调的情况下生成多帧、动作丰富的视觉叙事面临三个相互制约的挑战:动作文本忠实性、主体身份保真性以及跨帧背景连续性。我们提出StoryTailor,一个零样态管线,可在单张 RTX 4090(24 GB)上生成具有时序一致性、身份保持性的图像序列,输入为长篇叙事提示、每个主体的参考图像以及 grounding 框框。三个协同模块驱动该系统:高斯中心注意力(Gaussian-Centered Attention, GCA)用于动态聚焦每个主体核心并缓解 grounding 框框重叠;动作提升奇异值重加权(Action-Boost Singular Value Reweighting, AB-SVR)用于放大文本嵌入空间中的动作相关方向;选择性遗忘缓存(Selective Forgetting Cache, SFC)用于保留可迁移的背景线索、遗忘非必需历史,并选择性地呈现保留线索以构建跨场景语义联系。与基线方法相比,实验表明 CLIP-T 可提升最高达 10-15%,DreamSim 低于强基线,而 CLIP-I 保持在视觉上可接受、具竞争力的范围内。在 matched 分辨率和步数下,推理速度快于 FluxKontext。定性地,StoryTailor 交付富有表现力的互动和演变但保持稳定的场景。

关键词

引用

@article{arxiv.2602.21273,
  title  = {StoryTailor:A Zero-Shot Pipeline for Action-Rich Multi-Subject Visual Narratives},
  author = {Jinghao Hu and Yuhe Zhang and GuoHua Geng and Kang Li and Han Zhang},
  journal= {arXiv preprint arXiv:2602.21273},
  year   = {2026}
}

备注

24 pages,19 figures,accepted by CVPR2026