视频动作差异检测
计算机视觉与模式识别
2025-03-12 v1 人工智能
机器学习
摘要
两个人执行相同动作时有何不同?在本工作中,我们引入了视频动作差异检测(Video Action Differencing, VidDiff),即识别同一动作的两个视频之间细微差异的新任务,该任务具有许多应用,如教练指导和技能学习。为推动这一新任务的发展,我们首先构建了 VidDiffBench,一个包含 549 个视频对的基准数据集,其中包含 4,469 个细粒度动作差异的人工标注以及 2,075 个定位时间戳,用于指示这些差异发生的位置。我们的实验表明,VidDiffBench 对最先进的通用多模态模型(LMMs),如 GPT-4o 和 Qwen2-VL,构成了重大挑战。通过分析 LMMs 在 VidDiffBench 上的失败案例,我们揭示了该任务的两大关键挑战:在两个视频中定位相关子动作以及细粒度帧比较。为克服这些挑战,我们提出了 VidDiff 方法,一种将任务分解为三个阶段的智能体工作流:动作差异提议、关键帧定位和帧差分,每个阶段利用专门的基础模型。为鼓励未来在这一新任务上的研究,我们在 https://huggingface.co/datasets/jmhb/VidDiffBench 发布了基准数据集,在 http://jmhb0.github.io/viddiff 发布了代码。
引用
@article{arxiv.2503.07860,
title = {Video Action Differencing},
author = {James Burgess and Xiaohan Wang and Yuhui Zhang and Anita Rau and Alejandro Lozano and Lisa Dunlap and Trevor Darrell and Serena Yeung-Levy},
journal= {arXiv preprint arXiv:2503.07860},
year = {2025}
}
备注
ICLR 2025 (International Conference on Learning Representations) Project page: http://jmhb0.github.io/viddiff Benchmark: https://huggingface.co/datasets/jmhb/VidDiffBench