学习时空语义对应
计算机视觉与模式识别
2023-06-21 v1
摘要
我们提出视频中时空语义对应预测的一项新任务。给定源视频、目标视频以及源视频中的一组时空关键点,该任务要求预测目标视频中作为所给源关键点语义对应的一组关键点。我们认为该任务对于细粒度视频理解十分重要,潜在地赋能诸如动作指导、体育分析、机器人模仿学习等应用。本文的贡献在于:(i) 提出一项新任务,并在两个现有基准 Penn Action 与 Pouring 上提供时空语义对应的标注;以及 (ii) 给出全面的基线方法与实验以洞察这一新问题。我们的主要发现是:时空语义对应预测问题最好在空间与时间上联合处理,而非在其分解的子问题(时间对齐与空间对应)中分别处理。
引用
@article{arxiv.2306.10208,
title = {Learning Space-Time Semantic Correspondences},
author = {Du Tran and Jitendra Malik},
journal= {arXiv preprint arXiv:2306.10208},
year = {2023}
}