GenHowTo:从教学视频中学习生成动作与状态转换
计算机视觉与模式识别
2024-04-03 v2
摘要
我们致力于生成时间一致且物理合理的动作与物体状态转换图像。给定一张输入图像和一段描述目标转换的文本提示,我们生成的图像能够保留初始图像中的环境并对物体进行转换。我们的贡献有三方面。首先,我们利用大量教学视频,自动挖掘出一个由对应于初始物体状态、动作以及物体转换结果的连续帧构成的三元组数据集。其次,基于这些数据,我们开发并训练了一个名为 GenHowTo 的条件扩散模型。第三,我们在多种物体和动作上对 GenHowTo 进行了评估,结果表明其性能优于现有方法。特别地,我们引入了一种定量评估方法,GenHowTo 在已见和未见的交互类别上分别达到了 88% 和 74% 的准确率,大幅超越了先前的工作。
引用
@article{arxiv.2312.07322,
title = {GenHowTo: Learning to Generate Actions and State Transformations from Instructional Videos},
author = {Tomáš Souček and Dima Damen and Michael Wray and Ivan Laptev and Josef Sivic},
journal= {arXiv preprint arXiv:2312.07322},
year = {2024}
}
备注
CVPR 2024