常见动作在时间与空间上的少样本转换
计算机视觉与模式识别
2021-04-07 v1
摘要
本文引入了在时间与空间上定位少样本常见动作的任务。给定若干包含相同但未知动作的已裁剪支持视频,我们致力于在一段长的未裁剪查询视频中对该动作进行时空定位。我们不需要任何类别标签、区间边界或边界框。为应对这一挑战性任务,我们提出了一种新颖的少样本 transformer 架构,其具有专用的编码器-解码器结构,针对联合共性学习与定位预测进行了优化,且无需候选提议。在我们重新组织的 AVA 和 UCF101-24 数据集上的实验表明了我们的方法在少样本常见动作定位上的有效性,即使在支持视频含噪时亦然。尽管我们并非专为仅时间上的常见定位而设计,我们在该设定下也与少样本及单样本 SOTA 方法相比具有优势。最后,我们展示了该少样本 transformer 可轻易扩展至逐像素的常见动作定位。
引用
@article{arxiv.2104.02439,
title = {Few-Shot Transformation of Common Actions into Time and Space},
author = {Pengwan Yang and Pascal Mettes and Cees G. M. Snoek},
journal= {arXiv preprint arXiv:2104.02439},
year = {2021}
}