Stitch-a-Demo:来自多步骤描述的视频演示
计算机视觉与模式识别
2026-04-07 v3
摘要
在从文本描述获取视觉 illustrative 时,今天的方法采用单一文本上下文(如标题或动作描述)进行检索或生成匹配的视觉上下文。然而,现有工作不允许对多步骤描述(例如烹饪食谱或园艺说明书)进行视觉说明,仅按步骤处理将导致演示不连贯。我们提出 Stitch-a-Demo,一种新的检索式方法,用于从多步骤描述 assembling 视频演示。生成的视频包含来自不同来源的片段,准确反映所有步骤描述,同时保持视觉连贯性。我们构建训练管道,创建包含多样化程序的大规模弱监督数据,并注入硬负样本以促进正确性和连贯性。在野生 instructional videos 上验证的 Stitch-a-Demo 实现了状态突破性能, gains 最多可达 29%,并在人类偏好研究中取得显著胜出。
引用
@article{arxiv.2503.13821,
title = {Stitch-a-Demo: Video Demonstrations from Multistep Descriptions},
author = {Chi Hsuan Wu and Kumar Ashutosh and Kristen Grauman},
journal= {arXiv preprint arXiv:2503.13821},
year = {2026}
}