利用局部与全局特征无监督学习的视频对齐
计算机视觉与模式识别
2024-09-09 v3 机器学习
摘要
本文解决视频对齐问题,即匹配包含相似动作的一对视频的帧的过程。视频对齐的主要挑战在于,尽管两视频在执行过程与外观上存在差异,仍应建立准确的对应。我们引入一种利用帧的全局与局部特征的无监督对齐方法。具体而言,我们通过三种机器视觉工具——人体检测、姿态估计与 VGG 网络——为每视频帧提取有效特征,随后对特征进行处理与组合,构建表示视频的多维时间序列。所得时间序列用于通过一种称为对角化动态时间规整(DDTW)的动态时间规整新变体来对齐相同动作的视频。我们方法的主要优势是无需训练,这使其可适用于任何新动作类型而无需为其收集训练样本。此外,我们的方法可用于在仅含少量标注视频的数据集中对动作阶段进行逐帧标注。为评估,我们在 Penn action 与 UCF101 子集上考虑了视频同步与阶段分类任务。同时,为有效评估视频同步任务,我们提出一种称为包围面积误差(EAE)的新指标。结果表明,我们的方法优于以往的 SOTA 方法(如 TCC)以及其他自监督与弱监督方法。
引用
@article{arxiv.2304.06841,
title = {Video alignment using unsupervised learning of local and global features},
author = {Niloufar Fakhfour and Mohammad ShahverdiKondori and Sajjad Hashembeiki and Mohammadjavad Norouzi and Hoda Mohammadzade},
journal= {arXiv preprint arXiv:2304.06841},
year = {2024}
}
备注
11 pages, 6 figures