中文

基于查询自适应Transformer的小样本时序动作定位

计算机视觉与模式识别 2021-10-22 v1 机器学习 多媒体

摘要

现有时序动作定位(TAL)工作依赖大量带有详尽片段级标注的训练视频,阻碍其扩展到新类别。作为该问题的解决方案,小样本TAL(FS-TAL)旨在将模型适配到仅由极少(少至单个)视频表示的新类别。现有FS-TAL方法假设新类别使用修剪过的训练视频。然而,此设定不仅不自然——动作通常捕获于未修剪视频中,而且忽略了包含对前景动作分割至关重要的上下文线索的背景视频片段。在本文中,我们首先通过提出使用未修剪训练视频,给出一种新的FS-TAL设定。进一步,提出一种新颖的FS-TAL模型,其最大化从训练类别到新类别的知识迁移,同时使模型能够动态适配到新类别及该类别每个视频。这通过引入模型中的查询自适应Transformer实现。在两个动作定位基准上的大量实验表明,我们的方法在单域与跨域场景下均显著优于所有最先进替代方案。源代码见 https://github.com/sauradip/fewshotQAT。

关键词

引用

@article{arxiv.2110.10552,
  title  = {Few-Shot Temporal Action Localization with Query Adaptive Transformer},
  author = {Sauradip Nag and Xiatian Zhu and Tao Xiang},
  journal= {arXiv preprint arXiv:2110.10552},
  year   = {2021}
}

备注

BMVC 2021