Instructional Video 中的 Step Differences
计算机视觉与模式识别
2024-07-01 v2
摘要
将用户视频与参考操作视频进行比较是 AR/VR 技术交互式辅助的关键要求,但当前基于语言的方法只能回答关于单个视频的问题。我们提出一种方法,首先通过利用现有的步骤注释和伴随解说内容,自动生成大量涉及 HowTo100M 中视频对的视觉指令调优数据,然后训练视频条件语言模型以在多个原始视频之间进行联合推理。我们的模型在识别视频对之间的差异并对这些差异的严重程度进行排序方面实现了最先进的性能,显示出在多个视频上进行一般推理的有前景的能力。项目页面: https://github.com/facebookresearch/stepdiff
引用
@article{arxiv.2404.16222,
title = {Step Differences in Instructional Video},
author = {Tushar Nagarajan and Lorenzo Torresani},
journal= {arXiv preprint arXiv:2404.16222},
year = {2024}
}
备注
CVPR 2024