Temporal-Needle:一种视角与外观不变的视频描述符
计算机视觉与模式识别
2016-12-16 v1
摘要
跨视频检测相似动作的能力在许多领域的实际应用中非常有用。然而,由于呈现相同动作的视频可能从显著不同的视角拍摄、由不同演员和背景执行以及在不同视频质量下,该任务对现有系统仍具挑战性。视频描述符在这些系统中起重要作用。本文提出“temporal-needle”描述符,其捕获动态行为,同时对视角和外观不变。该描述符利用视频的多时间尺度计算,并通过每个时间尺度上随时间对每个块计算自相似性得到。为视频中每个像素计算描述符。但为跨视频寻找相似动作,仅考虑描述符的小子集——统计显著描述符。这使我们能更高效找到跨视频的良好对应。利用该描述符,我们能在多种场景下检测跨视频的相同行为。我们展示了描述符在时序与空间对齐、动作检测甚至无监督视频聚类到类别中的潜力。本文仅处理固定摄像机拍摄的视频,但该描述符可扩展至移动摄像机。
引用
@article{arxiv.1612.04854,
title = {Temporal-Needle: A view and appearance invariant video descriptor},
author = {Michal Yarom and Michal Irani},
journal= {arXiv preprint arXiv:1612.04854},
year = {2016}
}