中文

Stitch-a-Demo:来自多步骤描述的视频演示

计算机视觉与模式识别 2026-04-07 v3

摘要

在从文本描述获取视觉 illustrative 时,今天的方法采用单一文本上下文(如标题或动作描述)进行检索或生成匹配的视觉上下文。然而,现有工作不允许对多步骤描述(例如烹饪食谱或园艺说明书)进行视觉说明,仅按步骤处理将导致演示不连贯。我们提出 Stitch-a-Demo,一种新的检索式方法,用于从多步骤描述 assembling 视频演示。生成的视频包含来自不同来源的片段,准确反映所有步骤描述,同时保持视觉连贯性。我们构建训练管道,创建包含多样化程序的大规模弱监督数据,并注入硬负样本以促进正确性和连贯性。在野生 instructional videos 上验证的 Stitch-a-Demo 实现了状态突破性能, gains 最多可达 29%,并在人类偏好研究中取得显著胜出。

关键词

引用

@article{arxiv.2503.13821,
  title  = {Stitch-a-Demo: Video Demonstrations from Multistep Descriptions},
  author = {Chi Hsuan Wu and Kumar Ashutosh and Kristen Grauman},
  journal= {arXiv preprint arXiv:2503.13821},
  year   = {2026}
}