无需知晓边界的少样本动作定位
计算机视觉与模式识别
2021-09-24 v2
摘要
学习在冗长、杂乱且未裁剪视频中定位动作是一项困难任务,文献中通常假设每个类别有大量标注训练样本可用——或在已知动作边界的全监督设定下,或在仅知每视频类别标签的弱监督设定下。本文更进一步,表明在以下情况可学习在未裁剪视频中定位动作:a)测试时仅有一个/少数目标动作的裁剪样本可用;b)训练时可用仅含类别标签标注的大量视频(部分为裁剪、部分为弱标注未裁剪),且训练与测试所用类别无重叠。为此,我们提出一个学习估计时间相似度矩阵(TSMs)的网络,其建模视频对(裁剪或未裁剪)间细粒度相似模式,并用其生成可见或未见类别的时间类别激活图(TCAMs)。TCAMs 作为时间注意力机制提取未裁剪视频的视频级表示,并在测试时临时定位动作。据我们所知,我们首个提出可端到端训练的弱监督单/少样本动作定位网络。在 THUMOS14 与 ActivityNet1.2 数据集上的实验结果表明,我们的方法取得与最先进全监督少样本学习方法相当或更好的性能。
引用
@article{arxiv.2106.04150,
title = {Few-Shot Action Localization without Knowing Boundaries},
author = {Ting-Ting Xie and Christos Tzelepis and Fan Fu and Ioannis Patras},
journal= {arXiv preprint arXiv:2106.04150},
year = {2021}
}
备注
ICMR21 Camera ready; link to code: https://github.com/June01/WFSAL-icmr21