ShowHowTo: 生成基于场景的分步视觉指令
计算机视觉与模式识别
2025-03-26 v2
摘要
本工作旨在给定输入图像提供场景上下文和文本指令序列,生成以图像序列形式的分步视觉指令。这是一个具有挑战性的问题,因为需要在特定环境中实现复杂目标的多步骤图像序列生成。部分挑战源于缺乏大规模训练数据。本工作的贡献在于三方面:首先,我们引入一种自动收集基于 instructional video 的大规模分步视觉指令训练数据的方法。我们将该方法应用于100万个视频,创建了包含0.6M个图像-文本对的大规模高质量数据集。其次,我们开发并训练ShowHowTo,一种能够生成与提供的输入图像一致的分步视觉指令的视频扩散模型。最后,我们在三个维度上评估生成的图像序列的准确性(步骤、场景和任务),并显示我们的模型在所有方面均实现最先进的结果。我们的代码、数据集和训练好的模型已公开获取。
引用
@article{arxiv.2412.01987,
title = {ShowHowTo: Generating Scene-Conditioned Step-by-Step Visual Instructions},
author = {Tomáš Souček and Prajwal Gatti and Michael Wray and Ivan Laptev and Dima Damen and Josef Sivic},
journal= {arXiv preprint arXiv:2412.01987},
year = {2025}
}
备注
CVPR 2025